AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
搜索推理
1 篇相关内容
相关话题
强化学习
过程监督
归因方法
问答系统
LAPO:多轮搜索推理中自生成过程奖励的新方法
研究人员提出LAPO方法,通过后向单轮归因技术为多轮搜索推理生成过程监督奖励,无需额外奖励模型即可评估中间步骤贡献。
a
arXiv
·
5 天前
强化学习
搜索推理
过程监督
归因方法
a