A/B Agent:工业推荐策略迭代的自进化智能体

arXiv·28 天前

工业推荐系统的策略迭代长期依赖专家主导的大规模A/B测试,传统方法需要人工反复设计策略、配置实验并分析结果,过程耗时且知识难以系统化复用。现有检索增强生成(RAG)智能体虽能部分缓解负担,但通常以扁平方式组织经验,忽视了业务场景、推荐阶段、优化目标与实验上下文之间的层次关系,导致检索匹配度低、跨场景迁移能力有限,且无法通过连续的A/B反馈持续优化策略。

为此,研究团队提出A/B Agent——一个面向工业推荐策略优化的闭环智能体框架。该框架包含三个紧密耦合的核心模块:历史策略知识组织、自主目标感知策略生成、实验引导的策略自进化。系统将历史策略组织为分层经验树,通过多路径Tree-RAG检索可迁移证据以生成可执行策略,并持续分析在线A/B测试反馈,指导自主调参并更新经验树,实现自我进化。

离线与在线评估表明,该框架在真实短视频电商推荐系统中实现GMV提升4.829%,且所有护栏指标均保持正向收益。这一进展为自动化、可持续的工业级策略优化提供了新思路。

A/B测试推荐系统智能体工业AI自进化

原文来源:https://arxiv.org/abs/2608.04625

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回