BayesBench:多轮证据累积下评估大语言模型信念轨迹的新基准

arXiv·20 天前

大语言模型通常部署在多轮对话场景中,每轮新证据都应帮助模型减少对环境的认知不确定性。理性行为要求模型推断未观测变量,并随着证据积累更新信念。然而现有评估大多只关注单轮格式下的最终答案,忽视了这一动态过程。

来自学术界的这项研究提出核心问题:在多轮设置中,大语言模型的信念更新与理性贝叶斯推理者的匹配程度如何?为此,研究团队开发了BayesBench基准套件,通过三个渐进复杂的任务进行系统测评:

1. 贝叶斯估计:模型从序列证据中推断未知参数

2. 贝叶斯预测:模型将潜在变量的推断信念转化为结果预测

3. 潜在框架贝叶斯预测:观测数据通过用户角色框架过滤,要求对潜在状态和角色进行联合推断

研究测试了7个参数量从30亿到700亿的大语言模型。结果显示:模型规模扩大确实改善了潜在推断和证据累积能力,某些情况下更新甚至能匹配贝叶斯后验分布。但令人意外的是,这些提升并不能可靠地迁移到下游预测任务中,暴露出模型在推断潜在结构后,难以利用这些结构对目标结果进行理性信念更新的能力缺口。

这项工作首次为评估大语言模型的动态推理过程提供了系统框架,揭示了当前模型在持续学习与信念更新机制上的局限性。

大语言模型评估基准贝叶斯推理多轮对话认知不确定性

原文来源:https://arxiv.org/abs/2606.30850

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回