BV-Blend:融合历史基线,解决无评论家强化学习稳定性难题
在大型语言模型对齐任务中,基于可验证奖励的无评论家强化学习(如GRPO方法)因无需训练价值函数,相比传统PPO流程能显著降低计算与内存开销。然而,这类方法依赖提示组内的局部奖励统计进行优势估计,在奖励方差为零(如冷启动时所有结果获得相同奖励)的场景下容易陷入学习停滞。
为解决此问题,arXiv最新研究提出了BV-Blend框架。该框架创新性地将即时策略统计与基于语义集群的历史奖励矩相结合:为每个语义集群维护指数移动平均跟踪的奖励矩,通过标准误差均值代理计算置信权重,并以此权重融合历史基线统计与即时组内统计,最终生成用于PPO式裁剪更新的标准化优势估计。
实验表明,在可验证推理基准测试中,BV-Blend不仅能有效提升训练稳定性与最终性能,在传统组归一化方法可能停滞的极端场景下仍保持稳健。这一进展为高效稳定的语言模型对齐提供了新的技术路径,特别适用于依赖二元验证器的强化学习场景。