双向诱导机制揭秘:掩码扩散语言模型如何实现上下文学习
在人工智能语言模型领域,扩散语言模型作为新兴的文本生成范式,其内部工作机制一直较为神秘。近日,一项发表于arXiv的预印本研究深入剖析了这类模型如何实现“诱导”机制——即模型识别重复上下文并复制后续词汇的关键能力。研究团队通过对比注意力机制的自回归模型与采用吸收掩码的扩散语言模型发现,扩散模型构建了一种独特的双向诱导电路。该电路通过前向和后向注意力头将局部上下文信息写入残差流,再由专门的诱导头利用这些信息从匹配的源位置查找并复制答案。这种电路具有方向对称性,无论源信息出现在过去还是未来位置都能有效工作。值得注意的是,当仅左侧上下文可见时,扩散模型的诱导能力并未超越自回归模型;但当掩码标记两侧信息均可访问时,其表现显著提升。这表明扩散模型的优势源于双向上下文访问能力,而非单向机制的强化。研究还提供了因果证据,表明扩散模型能够计算掩码标记的全局比例,并将其作为隐式时间步长使用——尽管模型并未接收明确的时间步嵌入。这一发现为理解扩散语言模型的内在计算逻辑提供了新视角,也为未来模型设计提供了重要参考。