AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
PPO
2 篇相关内容
相关话题
强化学习
大语言模型
模型微调
探索算法
大模型对齐
奖励设计
训练稳定性
PPO-HSC:突破大模型微调“模式坍塌”的新探索式强化学习框架
研究者提出PPO-HSC框架,通过高阶采样覆盖奖励机制,解决大语言模型微调中的模式坍塌问题,在保持性能的同时显著提升解决方案多样性。
a
arXiv
·
5 小时前
强化学习
大语言模型
模型微调
PPO
a
BV-Blend:融合历史基线,解决无评论家强化学习稳定性难题
研究者提出BV-Blend框架,通过加权融合即时奖励统计与历史集群奖励信息,显著提升了无评论家强化学习在可验证奖励任务中的训练稳定性与性能。
a
arXiv
·
21 天前
强化学习
大模型对齐
PPO
奖励设计
a