AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
训练稳定性
1 篇相关内容
相关话题
强化学习
大模型对齐
PPO
奖励设计
BV-Blend:融合历史基线,解决无评论家强化学习稳定性难题
研究者提出BV-Blend框架,通过加权融合即时奖励统计与历史集群奖励信息,显著提升了无评论家强化学习在可验证奖励任务中的训练稳定性与性能。
a
arXiv
·
21 天前
强化学习
大模型对齐
PPO
奖励设计
a