电商运营长期连贯性新基准:MerchantBench 揭示大模型与人类差距

arXiv·31 天前

随着大语言模型智能体在自主工具使用方面的应用日益广泛,现有基准多集中于短期任务评估,缺乏对长期连贯决策能力的考察。长期连贯性指智能体在长时间跨度内保持目标导向行为,并能根据累积证据调整决策的能力。为填补这一空白,研究团队基于 98,843 条真实电商产品记录,构建了 MerchantBench——一个为期 365 天的订单级模拟环境。该环境包含产品采购、列表与定价控制、现金流管理及混合延迟反馈适应等 26 种工具,要求智能体跟踪订单全生命周期并适时调整早期决策。实验对 8 个大语言模型在两种智能体框架下进行了 48 次运行模拟。结果显示,即使最新模型也与人类表现存在显著差距:最优模型配置仅实现人类参与者平均最终净资产的 27.3%,突显了当前智能体在复杂长期任务中的局限性。MerchantBench 为评估智能体在真实场景中的持久决策能力提供了标准化测试平台。

大语言模型智能体电商基准测试决策连贯性

原文来源:https://arxiv.org/abs/2607.28956

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回