BV-Blend:融合历史基线,解决无评论家强化学习稳定性难题

arXiv·21 天前

在大型语言模型对齐任务中,基于可验证奖励的无评论家强化学习(如GRPO方法)因无需训练价值函数,相比传统PPO流程能显著降低计算与内存开销。然而,这类方法依赖提示组内的局部奖励统计进行优势估计,在奖励方差为零(如冷启动时所有结果获得相同奖励)的场景下容易陷入学习停滞。

为解决此问题,arXiv最新研究提出了BV-Blend框架。该框架创新性地将即时策略统计与基于语义集群的历史奖励矩相结合:为每个语义集群维护指数移动平均跟踪的奖励矩,通过标准误差均值代理计算置信权重,并以此权重融合历史基线统计与即时组内统计,最终生成用于PPO式裁剪更新的标准化优势估计。

实验表明,在可验证推理基准测试中,BV-Blend不仅能有效提升训练稳定性与最终性能,在传统组归一化方法可能停滞的极端场景下仍保持稳健。这一进展为高效稳定的语言模型对齐提供了新的技术路径,特别适用于依赖二元验证器的强化学习场景。

强化学习大模型对齐PPO奖励设计训练稳定性

原文来源:https://arxiv.org/abs/2606.28707

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回