EvoCUA-1.5:多轮计算机使用智能体在线强化学习新框架
计算机使用智能体需要在部分可观察的多模态桌面环境中完成长时程任务。虽然模仿学习和离线轨迹优化提供了良好先验,但静态轨迹无法覆盖真实计算机使用的因果反馈循环——每个动作都会改变屏幕状态、未来动作空间和恢复选项。
EvoCUA-1.5将自演化计算机使用智能体从离线经验学习扩展到在线强化学习,使策略能够在可执行沙盒环境中交互,并从可验证的任务结果中持续改进。多轮交互带来了独特挑战:需要管理上下文观察、处理稀疏终端奖励、处理可变长度轨迹,以及应对缓慢的环境反馈。
研究团队提出多项创新解决方案:
1. 步骤级策略优化(STEPO):将轨迹级优势平衡分解为步骤级样本后保持优化稳定性
2. 策略感知过滤与通过率校准:在可验证合成任务上优化训练效率
3. 动态三重自适应课程(DTAC):结合可学习任务、困难正向回放和受控不可行任务暴露
4. 完全异步RL基础设施:包含陈旧度控制和迷你组批处理
实验表明,这些组件显著提升了训练稳定性和下游性能。EvoCUA-1.5在OSWorld-Verified基准上达到63.2%的成功率,超越了同类32B/35B规模的开源基线模型,甚至接近参数量大得多的模型。该框架为多轮计算机使用智能体的在线强化学习规模化提供了实用解决方案。