无需强化学习!新方法让扩散大语言模型推理能力飙升
扩散大语言模型作为自回归生成模型的有力替代,在推理任务的后训练阶段面临挑战:监督微调需要密集但往往偏离策略的掩码状态,而强化学习则依赖稀疏奖励或价值建模。
最新研究提出轨迹对齐蒸馏方法,这是一种教师监督框架,无需奖励估计即可将推理能力迁移至目标扩散大语言模型。该方法的核心创新在于监督模型自身的去噪轨迹,重点关注形成最终响应的轨迹对齐标记决策。具体而言,该方法从目标模型采样策略内扩散轨迹,在对应部分去噪状态下获取教师模型的标记分布,并使用标记级反向KL目标更新目标模型。
实验结果显示,在数学推理基准测试中,该方法使SDAR-4B-Chat模型达到了与其强化学习训练版本TraDo-4B-Instruct相当的MATH500准确率,静态评估提升5.7个百分点,动态评估提升4.5个百分点。更值得关注的是,该方法仅需强化学习方法1/4的采样轮次,预计实现了96倍的计算效率提升,为扩散模型的实用化部署提供了新思路。