大语言模型中的算术神经元是否具有形式不变性?
大语言模型经常出现一个有趣现象:对同一问题的不同表述形式,有时能正确解答,有时却会失败。这种差异究竟源于模型内部存在不同的计算电路,还是同一电路在不同情境下的激活状态不同?最新发表在arXiv的机制可解释性研究给出了答案。
研究团队针对三个LLaMA-3模型,系统分析了符号算术、自然语言应用题和Python代码三种不同表达形式下的算术计算机制。通过结合归因修补和激活修补的两阶段分析流程,研究人员识别出模型中的算术启发式神经元。令人惊讶的是,三种格式共享着一组紧凑的神经元集合。
实验表明,这个共享电路对后期算术计算既是必要的也是充分的。当把共享神经元在一种格式中成功执行时的激活状态,移植到另一种格式的失败执行中时,模型能够恢复绝大多数错误预测——加减法任务的恢复率超过97%。这证明跨格式失败主要源于激活状态差异,而非存在独立电路。
更深入的分析发现,共享神经元在不同格式中始终属于相同的启发式家族,表明大语言模型中的算术计算在神经元层面具有显著的形式不变性。这项研究为理解大模型如何处理不同形式但本质相同的任务提供了新视角,对提高模型鲁棒性和可解释性具有重要意义。