SLIM-RL:无需轨迹切片的扩散大语言模型风险预算随机掩码强化学习

arXiv·19 天前

在扩散大语言模型的强化学习领域,当前主流方法普遍采用轨迹感知技术。最新研究SLIM-RL突破性地证明,随机掩码与模型推理轨迹的错配问题可通过风险控制机制解决,无需重建完整轨迹。该方法创新性地引入τ-预算解码器,对每个训练步骤的承诺风险设定上限,从而降低整体训练数据的累积风险。在优化过程中,SLIM-RL采用无轨迹随机掩码目标,结合序列级重要性采样和确定性积分技术,并设计了均值保持、单调递减的每块掩码调度策略。实验显示,在SDAR-4B模型上,SLIM-RL仅需0.46倍训练样本即可在块大小16时达到TraceRL的最佳MATH500准确率,在动态采样匹配条件下分别提升MATH500和GSM8K基准6.32%和11.05%。更值得注意的是,4B参数的SLIM-RL在块大小4时,数学能力超越更大的LLaDA-8B和Dream-7B模型,其中MATH500表现超出LLaDA-8B达10.76%,同时仍低于自回归模型Qwen2.5-7B。在代码生成任务中,该方法在MBPP和HumanEval基准上分别提升4.20%和3.65%。研究还发现τ-预算解码器具备跨模型迁移能力,可在LLaDA、Dream和SDAR架构间无需重新训练直接应用。开源代码已发布于GitHub平台。

扩散大语言模型强化学习随机掩码风险控制arXiv

原文来源:https://arxiv.org/abs/2607.00208

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回