BayesBench:多轮证据累积下评估大语言模型信念轨迹的新基准
大语言模型通常部署在多轮对话场景中,每轮新证据都应帮助模型减少对环境的认知不确定性。理性行为要求模型推断未观测变量,并随着证据积累更新信念。然而现有评估大多只关注单轮格式下的最终答案,忽视了这一动态过程。
来自学术界的这项研究提出核心问题:在多轮设置中,大语言模型的信念更新与理性贝叶斯推理者的匹配程度如何?为此,研究团队开发了BayesBench基准套件,通过三个渐进复杂的任务进行系统测评:
1. 贝叶斯估计:模型从序列证据中推断未知参数
2. 贝叶斯预测:模型将潜在变量的推断信念转化为结果预测
3. 潜在框架贝叶斯预测:观测数据通过用户角色框架过滤,要求对潜在状态和角色进行联合推断
研究测试了7个参数量从30亿到700亿的大语言模型。结果显示:模型规模扩大确实改善了潜在推断和证据累积能力,某些情况下更新甚至能匹配贝叶斯后验分布。但令人意外的是,这些提升并不能可靠地迁移到下游预测任务中,暴露出模型在推断潜在结构后,难以利用这些结构对目标结果进行理性信念更新的能力缺口。
这项工作首次为评估大语言模型的动态推理过程提供了系统框架,揭示了当前模型在持续学习与信念更新机制上的局限性。