AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
STOCKTAKE
1 篇相关内容
相关话题
大语言模型
决策评估
知行差距
AI基准测试
AI决策能力新标尺:STOCKTAKE如何量化大模型的“知行差距”
研究者提出STOCKTAKE评估框架,首次将大语言模型代理的“认知偏差”与“行动失败”分开测量,发现即使模型能准确识别问题,仍有34-43%的正确诊断周仍会导致库存短缺。
a
arXiv
·
5 天前
大语言模型
决策评估
STOCKTAKE
知行差距
a