AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
熵控制
1 篇相关内容
相关话题
强化学习
大语言模型
GEPO算法
多任务学习
新算法GEPO:按组控制熵值,提升大语言模型强化学习效果
研究人员提出GEPO算法,通过分组熵值控制解决多任务强化学习中探索与利用的平衡难题,在多个基准测试中表现优于现有方法。
a
arXiv
·
13 小时前
强化学习
大语言模型
熵控制
GEPO算法
a