PPO-HSC:突破大模型微调“模式坍塌”的新探索式强化学习框架
近日,arXiv发布了一项强化学习新研究PPO-HSC(基于高阶采样覆盖的近端策略优化),该框架旨在解决大语言模型微调中常见的“模式坍塌”问题。传统基于可验证奖励的强化学习方法虽然能有效强化高奖励轨迹,但容易导致模型过度优化已知解决方案,牺牲了探索更广泛解空间的能力。
PPO-HSC创新性地引入了高阶采样覆盖奖励机制,激励模型发现“低相似度但高有效性”的推理模式。该框架维护一个动态的已验证独特解决方案轨迹库,通过可微分信号奖励语义新颖性,同时通过合理性约束确保结构理性。
在数学推理(GSM8K、SVAMP)和代码生成任务上的实证评估表明,PPO-HSC在保持或超越现有强化学习基线准确性和语法完整性的同时,显著提升了解决方案多样性和状态空间覆盖率。这一研究为提升大语言模型的探索能力和创造性推理提供了新思路,有望推动更稳健、更具泛化能力的AI系统发展。