AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多轮交互
2 篇相关内容
相关话题
强化学习
计算机使用智能体
在线学习
AI系统
策略蒸馏
智能体训练
误差累积
置信度加权
EvoCUA-1.5:多轮计算机使用智能体在线强化学习新框架
EvoCUA-1.5将计算机使用智能体从离线经验学习扩展到在线强化学习,通过创新算法解决多轮交互中的观察管理、稀疏奖励等挑战,在OSWorld-Verified基准上取得63.2%的成功率。
a
arXiv
·
7 天前
强化学习
计算机使用智能体
多轮交互
在线学习
a
SAGE-OPD:多轮策略蒸馏中的选择性干预新框架
研究者提出SAGE-OPD框架,通过选择性干预和置信度加权,有效解决多轮智能体训练中的误差累积问题,在ALFWorld任务上实现13.3%的性能提升。
a
arXiv
·
31 天前
策略蒸馏
智能体训练
多轮交互
误差累积
a