无需强化学习!新方法让扩散大语言模型推理能力飙升

arXiv·9 小时前

扩散大语言模型作为自回归生成模型的有力替代,在推理任务的后训练阶段面临挑战:监督微调需要密集但往往偏离策略的掩码状态,而强化学习则依赖稀疏奖励或价值建模。

最新研究提出轨迹对齐蒸馏方法,这是一种教师监督框架,无需奖励估计即可将推理能力迁移至目标扩散大语言模型。该方法的核心创新在于监督模型自身的去噪轨迹,重点关注形成最终响应的轨迹对齐标记决策。具体而言,该方法从目标模型采样策略内扩散轨迹,在对应部分去噪状态下获取教师模型的标记分布,并使用标记级反向KL目标更新目标模型。

实验结果显示,在数学推理基准测试中,该方法使SDAR-4B-Chat模型达到了与其强化学习训练版本TraDo-4B-Instruct相当的MATH500准确率,静态评估提升5.7个百分点,动态评估提升4.5个百分点。更值得关注的是,该方法仅需强化学习方法1/4的采样轮次,预计实现了96倍的计算效率提升,为扩散模型的实用化部署提供了新思路。

扩散大语言模型模型蒸馏推理能力arXiv计算效率

原文来源:https://arxiv.org/abs/2607.16872

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回