PPO-HSC:突破大模型微调“模式坍塌”的新探索式强化学习框架

arXiv·10 小时前

近日,arXiv发布了一项强化学习新研究PPO-HSC(基于高阶采样覆盖的近端策略优化),该框架旨在解决大语言模型微调中常见的“模式坍塌”问题。传统基于可验证奖励的强化学习方法虽然能有效强化高奖励轨迹,但容易导致模型过度优化已知解决方案,牺牲了探索更广泛解空间的能力。

PPO-HSC创新性地引入了高阶采样覆盖奖励机制,激励模型发现“低相似度但高有效性”的推理模式。该框架维护一个动态的已验证独特解决方案轨迹库,通过可微分信号奖励语义新颖性,同时通过合理性约束确保结构理性。

在数学推理(GSM8K、SVAMP)和代码生成任务上的实证评估表明,PPO-HSC在保持或超越现有强化学习基线准确性和语法完整性的同时,显著提升了解决方案多样性和状态空间覆盖率。这一研究为提升大语言模型的探索能力和创造性推理提供了新思路,有望推动更稳健、更具泛化能力的AI系统发展。

强化学习大语言模型模型微调PPO探索算法

原文来源:https://arxiv.org/abs/2607.16206

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回