AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
策略蒸馏
1 篇相关内容
相关话题
智能体训练
多轮交互
误差累积
置信度加权
SAGE-OPD:多轮策略蒸馏中的选择性干预新框架
研究者提出SAGE-OPD框架,通过选择性干预和置信度加权,有效解决多轮智能体训练中的误差累积问题,在ALFWorld任务上实现13.3%的性能提升。
a
arXiv
·
31 天前
策略蒸馏
智能体训练
多轮交互
误差累积
a