AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
Qwen模型
2 篇相关内容
相关话题
多语言推理
日语大模型
GRPO训练
推理性能
强化学习
工具调用
企业API
工作流自动化
非英语推理成本研究:日语大模型推理性能探秘
最新研究发现,虽然可通过GRPO训练让大模型实现日语推理,但其性能仅与英语推理基线持平,且日语推理并未带来文化相关任务的免费提升。
a
arXiv
·
7 天前
多语言推理
Qwen模型
日语大模型
GRPO训练
a
超越下一词预测:RLVR方法在Atlassian工具调用智能体上的概念验证
研究团队提出RLVR方法,通过强化学习与可验证奖励机制,显著提升小型语言模型在企业API工作流中的工具调用准确率,在Jira和Confluence模拟环境中实现从0.35到接近1.00的性能跃升。
a
arXiv
·
18 天前
强化学习
工具调用
企业API
Qwen模型
a