超越下一词预测:RLVR方法在Atlassian工具调用智能体上的概念验证
大型语言模型通常基于下一词预测目标进行训练,这种训练方式与特定API操作需求存在根本性错配,导致在企业SaaS工作流中出现静默故障——如遗漏必填字段、虚构工具或过早终止操作。为解决这一问题,研究团队提出了强化学习与可验证奖励机制相结合的方法,直接在目标环境中进行训练优化。
作为概念验证,研究团队构建了五个模拟环境,精确复现Jira REST v3和Confluence v2 API的架构特性。奖励机制完全基于工具调用轨迹计算,无需真实API接口、学习型评判器或人工标注参与。实验选取Qwen3-1.7B和Qwen3.5-4B模型进行测试,使用与GRPO训练相同的检查器进行评估。
结果显示,在四个非退化奖励场景中,经过RL训练的策略将平均奖励从4B基线模型的0.35-0.92区间提升至0.95-1.00,其中Confluence页面创建任务提升最为显著。这项研究为面向细分企业API的结果优化型小模型开发提供了初步探索,同时指出两个关键限制:可验证奖励的手工设计难以扩展到更多端点;部分场景的奖励函数存在饱和特性,基线模型已接近性能上限。