AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
探索算法
1 篇相关内容
相关话题
强化学习
大语言模型
模型微调
PPO
PPO-HSC:突破大模型微调“模式坍塌”的新探索式强化学习框架
研究者提出PPO-HSC框架,通过高阶采样覆盖奖励机制,解决大语言模型微调中的模式坍塌问题,在保持性能的同时显著提升解决方案多样性。
a
arXiv
·
10 小时前
强化学习
大语言模型
模型微调
PPO
a