语言模型如何统一处理多种心理空间?研究发现共享路由机制
人类语言能够构建超越现实的心理空间,如绘画场景、信念系统、记忆回溯和假设情境。传统形式语义学认为这些空间逻辑不同需要分别处理,而认知语言学的心理空间理论则将其视为统一的空间构建操作。最新研究通过分析Transformer语言模型的工作机制,发现模型实际上采用了接近心理空间理论的统一处理方式。
研究团队在三个不同模型家族中发现,语言模型使用一个可复用的“值槽”存储属性内容,并通过一个可因果操纵的“路由器”选择读取哪个心理空间。令人惊讶的是,当模型被训练控制某类心理空间(如反事实、信念、虚构或时间)时,这种控制能力能够迁移到其他类型的心理空间,显著高于随机水平。即使在形式语义学中被视为特殊案例的“信念”空间,在模型中也没有被特别分离处理。
进一步分析显示,这种路由器机制具有低秩特性,能够与实体身份进行加性组合,主要通过模型后期层的少数注意力头实现操作。实验还证明该机制驱动推理过程并支持组合:训练用于规则推导结论的子空间能够翻转模型的推理结果,同时与模型报告的内容解耦;组合空间构建器则能在共享值槽上创建新的路由器。
这项研究揭示了语言模型处理多种心理空间的统一机制,为理解模型如何管理复杂语义信息提供了新视角。研究团队表示,由于信念在哲学、心理学和语言学中的特殊地位,将在后续论文中深入探讨这一主题。