A/B Agent:工业推荐策略迭代的自进化智能体
工业推荐系统的策略迭代长期依赖专家主导的大规模A/B测试,传统方法需要人工反复设计策略、配置实验并分析结果,过程耗时且知识难以系统化复用。现有检索增强生成(RAG)智能体虽能部分缓解负担,但通常以扁平方式组织经验,忽视了业务场景、推荐阶段、优化目标与实验上下文之间的层次关系,导致检索匹配度低、跨场景迁移能力有限,且无法通过连续的A/B反馈持续优化策略。
为此,研究团队提出A/B Agent——一个面向工业推荐策略优化的闭环智能体框架。该框架包含三个紧密耦合的核心模块:历史策略知识组织、自主目标感知策略生成、实验引导的策略自进化。系统将历史策略组织为分层经验树,通过多路径Tree-RAG检索可迁移证据以生成可执行策略,并持续分析在线A/B测试反馈,指导自主调参并更新经验树,实现自我进化。
离线与在线评估表明,该框架在真实短视频电商推荐系统中实现GMV提升4.829%,且所有护栏指标均保持正向收益。这一进展为自动化、可持续的工业级策略优化提供了新思路。