语言模型如何区分角色信念与现实?新研究揭示「信念-现实分离」机制
当语言模型被输入「安娜相信杯子是蓝色的;实际上它是红色的」这类包含信念与现实矛盾的语句时,它们能够准确区分角色认知与客观事实——回答安娜认为蓝色,而现实是红色。这项发表于arXiv的研究深入探究了这种「信念-现实分离」现象的计算实现机制。
研究团队发现,分离依赖于两个独立机制:一个通用的「值槽」负责绑定被赋予的值,而位于查询位置的「路由器」则选择从哪个认知框架(角色信念或客观现实)读取信息。具体而言,存在两种填充值槽的路径:对于文本直接提供的「断言信念」,其值直接绑定;对于需要根据角色可见性推断的「衍生信念」,则通过可见性门控的回溯机制获取。
关键发现是,值槽本身并不携带信念或现实的标签——对其进行干预会同等影响两个框架的读取。真正的分离存在于一对解耦的路由子空间中,它们能在不注入捐赠者值的情况下,切换查询的认知框架。这一机制在三种不同架构的模型中均得到验证,且研究特别设计了排除心智理论基准测试常见捷径干扰的刺激材料。
有趣的是,模型表现出的信念-现实分离能力在3B到7B参数规模之间逐渐显现,跨越五个模型家族。论文深入探讨了单一信念-现实轴线的运作原理,其姊妹篇进一步揭示,相同的「槽-路由器」格式也适用于句子可能开启的其他非实际语境(如反事实、虚构、时间差异)。这项研究为理解语言模型如何处理多重视角信息提供了重要的计算神经科学视角。