双向诱导机制揭秘:掩码扩散语言模型如何实现上下文学习

arXiv·1 天前

在人工智能语言模型领域,扩散语言模型作为新兴的文本生成范式,其内部工作机制一直较为神秘。近日,一项发表于arXiv的预印本研究深入剖析了这类模型如何实现“诱导”机制——即模型识别重复上下文并复制后续词汇的关键能力。研究团队通过对比注意力机制的自回归模型与采用吸收掩码的扩散语言模型发现,扩散模型构建了一种独特的双向诱导电路。该电路通过前向和后向注意力头将局部上下文信息写入残差流,再由专门的诱导头利用这些信息从匹配的源位置查找并复制答案。这种电路具有方向对称性,无论源信息出现在过去还是未来位置都能有效工作。值得注意的是,当仅左侧上下文可见时,扩散模型的诱导能力并未超越自回归模型;但当掩码标记两侧信息均可访问时,其表现显著提升。这表明扩散模型的优势源于双向上下文访问能力,而非单向机制的强化。研究还提供了因果证据,表明扩散模型能够计算掩码标记的全局比例,并将其作为隐式时间步长使用——尽管模型并未接收明确的时间步嵌入。这一发现为理解扩散语言模型的内在计算逻辑提供了新视角,也为未来模型设计提供了重要参考。

扩散语言模型上下文学习注意力机制模型可解释性文本生成

原文来源:https://arxiv.org/abs/2607.15893

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回