超越下一词预测:RLVR方法在Atlassian工具调用智能体上的概念验证

arXiv·18 天前

大型语言模型通常基于下一词预测目标进行训练,这种训练方式与特定API操作需求存在根本性错配,导致在企业SaaS工作流中出现静默故障——如遗漏必填字段、虚构工具或过早终止操作。为解决这一问题,研究团队提出了强化学习与可验证奖励机制相结合的方法,直接在目标环境中进行训练优化。

作为概念验证,研究团队构建了五个模拟环境,精确复现Jira REST v3和Confluence v2 API的架构特性。奖励机制完全基于工具调用轨迹计算,无需真实API接口、学习型评判器或人工标注参与。实验选取Qwen3-1.7B和Qwen3.5-4B模型进行测试,使用与GRPO训练相同的检查器进行评估。

结果显示,在四个非退化奖励场景中,经过RL训练的策略将平均奖励从4B基线模型的0.35-0.92区间提升至0.95-1.00,其中Confluence页面创建任务提升最为显著。这项研究为面向细分企业API的结果优化型小模型开发提供了初步探索,同时指出两个关键限制:可验证奖励的手工设计难以扩展到更多端点;部分场景的奖励函数存在饱和特性,基线模型已接近性能上限。

强化学习工具调用企业APIQwen模型工作流自动化

原文来源:https://arxiv.org/abs/2607.01465

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回