AI决策能力新标尺:STOCKTAKE如何量化大模型的“知行差距”
在复杂决策任务中,大语言模型代理的表现评估一直面临挑战:当最终成本不理想时,我们无法区分究竟是模型误判了环境状态,还是虽然正确认知却未能采取有效行动——这种“知行差距”长期缺乏量化工具。
来自学术界的STOCKTAKE基准测试填补了这一空白。该框架构建了一个为期26周的供应链补货模拟环境,采用因子化部分可观测马尔可夫决策过程,包含六个隐藏的因子过程。其创新之处在于设计了一个“公平先知”参考策略:基于与代理完全相同的观测流,通过每个因子的精确贝叶斯滤波器驱动决策,为评估提供了公正的基准。
评估体系包含三个关键指标:技能分数(0到1分,0分对应无视症状的基础库存策略,1分对应先知策略)、陈述信念检测延迟(通过每周书面理由评分)以及知行比率。这种设计首次实现了状态估计与控制能力的分离测量。
在对Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5四个主流模型的测试中,研究发现了一个矛盾现象:所有模型都能在84-88%的情况下检测到隐藏故障(通常在故障发生一周内),但技能分数却从0.62到-0.23分布悬殊。更令人惊讶的是,四个模型中竟有两个的表现低于无视症状的基础策略,尽管它们识别因子的速度略快于表现更好的模型。
深入分析揭示了“知行差距”的双重面孔:在持续压力情境下,即使模型正确诊断了问题周,仍有34-43%的概率最终出现库存短缺。这种失败率部分反映了模型所关注压力周的严重程度,但更关键的是,它与技能分数呈现反向关系——表现低于基准的两个模型在诊断周的实际缺货率反而最低。
这表明“反应不足”只是问题的一面,另一面则是“过度反应”——某些行动的成本甚至超过了它们所能保护的价值。STOCKTAKE框架的价值正在于能够同时测量这两个方向的失败,为大语言模型代理的决策能力评估提供了前所未有的精细视角。