新算法GEPO:按组控制熵值,提升大语言模型强化学习效果
在大型语言模型的强化学习对齐过程中,熵控制已成为平衡探索与利用的有效工具。然而,当模型面对混合异构任务时,同一策略下会产生不同的熵状态,使得全局或词元级别的熵调节难以满足多样化的探索需求。这种异质性还导致GRPO风格的标准化优势函数产生熵依赖偏差,使得不同提示组间的优势信号在统计上不可比。
针对这一问题,研究团队提出了分组熵控制策略优化算法GEPO。该算法作为GRPO的轻量级扩展,利用现有分组样本估计分组熵值,执行熵条件非对称优势塑形。GEPO通过自适应阈值(基于历史熵统计得出)在低熵组中衰减正优势以减少过度利用,在高熵组中衰减负优势以保持探索。
研究团队在两个基础模型上进行了广泛实验,覆盖数学、物理、科学、代码生成和指令遵循等13个基准测试。结果显示,GEPO在各项任务中均优于GRPO及近期熵控制方法,实现了跨任务的平衡改进,同时在训练过程中保持了任务特定的探索水平。这一进展为多任务强化学习对齐提供了更精细的调控手段。