AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
随机掩码
1 篇相关内容
相关话题
扩散大语言模型
强化学习
风险控制
arXiv
SLIM-RL:无需轨迹切片的扩散大语言模型风险预算随机掩码强化学习
研究者提出SLIM-RL方法,通过风险预算解码器控制扩散大语言模型训练中的承诺风险,在多项数学与代码基准测试中超越现有轨迹感知方法,且无需重建推理轨迹。
a
arXiv
·
19 天前
扩散大语言模型
强化学习
随机掩码
风险控制
a