新算法GEPO:按组控制熵值,提升大语言模型强化学习效果

arXiv·13 小时前

在大型语言模型的强化学习对齐过程中,熵控制已成为平衡探索与利用的有效工具。然而,当模型面对混合异构任务时,同一策略下会产生不同的熵状态,使得全局或词元级别的熵调节难以满足多样化的探索需求。这种异质性还导致GRPO风格的标准化优势函数产生熵依赖偏差,使得不同提示组间的优势信号在统计上不可比。

针对这一问题,研究团队提出了分组熵控制策略优化算法GEPO。该算法作为GRPO的轻量级扩展,利用现有分组样本估计分组熵值,执行熵条件非对称优势塑形。GEPO通过自适应阈值(基于历史熵统计得出)在低熵组中衰减正优势以减少过度利用,在高熵组中衰减负优势以保持探索。

研究团队在两个基础模型上进行了广泛实验,覆盖数学、物理、科学、代码生成和指令遵循等13个基准测试。结果显示,GEPO在各项任务中均优于GRPO及近期熵控制方法,实现了跨任务的平衡改进,同时在训练过程中保持了任务特定的探索水平。这一进展为多任务强化学习对齐提供了更精细的调控手段。

强化学习大语言模型熵控制GEPO算法多任务学习

原文来源:https://arxiv.org/abs/2607.16850

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回