揭秘大语言模型的“倒计时”通用机制:同一子电路实现多任务计数
无论是生成恰好十二个单词的句子,还是在正确密码子处终止DNA序列,抑或是格式化ASCII表格,这些看似不同的任务都要求语言模型能够追踪距离目标还有多少“剩余步数”。近日,一项发表于arXiv的研究在Llama-3.1-70B-Instruct模型中识别出了一个执行此类任务的通用机制——一个“倒计时子电路”。
该子电路的核心功能是持续比较模型当前生成的位置与预设的目标长度,并动态估算完成目标所需的剩余“时间”或步骤。研究人员首先在一个受控环境中分离出该电路:让模型完成生成固定长度并以特定单词结尾的句子任务。随后,他们深入分析了该子电路所用表征的几何结构,发现其使用了一种与先前在另一前沿大模型、不同任务中识别出的完全相同的“计算模式”。这表明该“倒计时”模式可能是跨模型共享的通用构建模块。
更引人注目的是,通过在一个自然语言数据集上进行无监督探测,研究团队发现了该子电路被用于多种其他任务,其中一些任务的目标长度并非明确给出,而是需要模型从上下文语境中推断得出。这项工作表明,通过逆向工程剖析模型内部的特定功能子电路,能够帮助我们理解单一行为模式是如何从一个具体示例泛化到众多不同任务,甚至跨越不同模型架构的。这为理解大语言模型如何形成和复用通用能力提供了新的视角。