无需预设长度!PILL方法显著提升扩散语言模型填充效率
扩散语言模型(DLMs)作为自回归模型的有力竞争者,凭借其双向注意力和任意顺序生成能力,天然适合文本填充任务——即根据前后文生成中间段落。然而,传统DLMs在填充时需要预先确定生成长度,这在实际应用中存在明显局限。
虽然已有研究尝试将DLMs扩展到动态长度生成,但仍面临两大挑战:一是对初始长度设置敏感,预设长度直接影响生成质量;二是推理效率低下,现有方法要么在生成过程中插入长度调整操作,要么需要多次去噪置信度搜索,都引入了大量额外计算开销。
针对这些问题,研究团队提出了PILL(基于探测的无预设长度填充解码)方法。该方法创新性地避免了预设初始长度的需求,同时大幅减少了额外前向传播次数,显著降低了推理时间。在实验中,研究人员测试了五种不同架构和训练方式的DLMs模型,覆盖八个文本填充基准测试。结果显示,PILL在代码生成任务上平均通过率提升4.8%,在文本生成任务上BLEU-2得分提高6.0%,同时推理速度比最强基线快1.82倍。
这项研究为扩散语言模型的实际应用提供了更高效的解决方案,特别是在需要灵活长度生成的场景中展现出明显优势。相关代码已在GitHub开源。