大模型如何学会“读心”?研究揭示情境建模与心智化能力的发展轨迹
近期研究表明,大语言模型(LLMs)能够通过错误信念任务(FBT)表现出对文本中描述角色信念状态的敏感性,但其能力的构造有效性仍存争议。一项发表于arXiv的新研究从发展视角切入,追踪了Olmo2与Pythia系列模型在不同训练阶段中心智推理行为(及其潜在前提条件)的演变模式。研究发现,模型在错误信念任务上超越随机水平的表现,既依赖于模型规模,也需要足够的训练量,且该能力在预训练后期才相对较晚地出现。在最具诊断性的心智化条件(错误信念、隐性信念)下,后训练干预(如SFT、DPO)对性能提升最为明显。然而,这种心智推理能力十分脆弱:与过往研究一致,使用非事实性动词(如“认为”)即使在真实信念条件下也会增加错误信念归因。为理解这些发现,研究同时追踪了情境建模能力的出现——即模型报告所描述场景基本事实属性的能力。情境建模的准确性普遍先于并超过错误信念任务表现,但情境表征在某些方面也表现出令人惊讶的不一致性:当被问及反派角色(始终知晓物品真实位置)的知识状态时,Olmo2 13b模型持续受到目标角色知识状态以及非事实性动词存在的影响。综合来看,这些结果表明,规模更大、训练更充分的模型会以符合发展顺序的方式构建部分连贯的情境模型,但仍表现出显著的脆弱性——这凸显了采用发展性视角和压力测试方法评估大语言模型能力的价值。