电商运营长期连贯性新基准:MerchantBench 揭示大模型与人类差距
随着大语言模型智能体在自主工具使用方面的应用日益广泛,现有基准多集中于短期任务评估,缺乏对长期连贯决策能力的考察。长期连贯性指智能体在长时间跨度内保持目标导向行为,并能根据累积证据调整决策的能力。为填补这一空白,研究团队基于 98,843 条真实电商产品记录,构建了 MerchantBench——一个为期 365 天的订单级模拟环境。该环境包含产品采购、列表与定价控制、现金流管理及混合延迟反馈适应等 26 种工具,要求智能体跟踪订单全生命周期并适时调整早期决策。实验对 8 个大语言模型在两种智能体框架下进行了 48 次运行模拟。结果显示,即使最新模型也与人类表现存在显著差距:最优模型配置仅实现人类参与者平均最终净资产的 27.3%,突显了当前智能体在复杂长期任务中的局限性。MerchantBench 为评估智能体在真实场景中的持久决策能力提供了标准化测试平台。