AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
过程监督
2 篇相关内容
相关话题
强化学习
搜索推理
归因方法
问答系统
大语言模型
数学推理
通义千问
AI可靠性
LAPO:多轮搜索推理中自生成过程奖励的新方法
研究人员提出LAPO方法,通过后向单轮归因技术为多轮搜索推理生成过程监督奖励,无需额外奖励模型即可评估中间步骤贡献。
a
arXiv
·
5 天前
强化学习
搜索推理
过程监督
归因方法
a
通义千问团队探索数学推理过程监督新方法,提升大模型可靠性
针对大语言模型在数学推理中可能产生计算错误或逻辑漏洞的问题,通义千问团队提出过程监督新思路,旨在提升推理过程的可信度。
通
通义千问 Qwen
·
28 天前
大语言模型
数学推理
过程监督
通义千问
通