新型扩散语言模型:每个token都有自己的“时间线”

arXiv·4 天前

近日,arXiv平台发布了一项关于扩散语言模型的新研究。论文提出Token Time Continuous Diffusion模型,该模型在连续空间中进行操作,能够将高斯噪声确定性地映射到最终的token画布,无需额外采样。

该模型的核心创新在于引入了“每个token独立时间”的概念,允许不同token以不同速率从噪声状态转换为最终token。这种设计使模型在条件生成任务中表现更优,让确定性更高的token能够更快完成转换,并在细化过程中实现差异化的token间影响。

研究团队在OpenWebText数据集上训练了一个1.6亿参数的TTCD模型,并通过自蒸馏技术进行优化。实验结果显示,在高速推理场景下,该模型在无条件生成质量上与同类模型相当,在条件生成任务中则明显优于相同规模、相同数据集训练且经过自蒸馏的现有模型。此外,在数独求解任务中也取得了类似的效果提升。

连续空间建模帮助TTCD避免了传统离散空间模型中常见的多token并行采样问题,这正是高速推理时准确率下降的关键原因。这项研究为扩散模型在自然语言处理领域的应用提供了新的思路。

扩散模型语言模型自然语言处理arXiv连续空间建模

原文来源:https://arxiv.org/abs/2607.14106

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回