AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
决策连贯性
1 篇相关内容
相关话题
大语言模型
智能体
电商
基准测试
电商运营长期连贯性新基准:MerchantBench 揭示大模型与人类差距
研究者推出 MerchantBench 基准,用于评估大语言模型智能体在电商运营中的长期连贯决策能力,实验显示当前最优模型仅达到人类平均最终净资产的 27.3%。
a
arXiv
·
31 天前
大语言模型
智能体
电商
基准测试
a