iLLaDA:8B参数双向扩散语言模型,非自回归训练展现竞争力
近日,一项发表于arXiv的研究提出了一种名为iLLaDA的新型大型语言模型。该模型采用8B参数规模,创新性地使用完全双向注意力的掩码扩散目标进行从头训练,突破了当前主流语言模型依赖自回归因子化和因果注意力的范式。
研究团队在预训练阶段使用了12T令牌的数据规模,并在监督微调阶段使用了25B令牌的指令语料进行12轮训练。为提升效率,模型引入了可变长度生成技术,并采用基于置信度的评分机制用于多项选择题评估。
实验结果显示,iLLaDA在通用、数学和代码等多个基准测试中均取得显著提升。其中,iLLaDA-Base在BBH基准上提升21.6分,在ARC-Challenge上提升14.9分;iLLaDA-Instruct在MATH基准上提升14.5分,在HumanEval上提升16.5分。值得注意的是,尽管采用非自回归训练方式,iLLaDA在多项基准测试中仍与Qwen2.5 7B模型表现相当。
这些成果表明,完全双向的扩散训练路径能够成为构建强大语言模型的有效替代方案。模型权重和代码已在GitHub开源。