非英语推理成本研究:日语大模型推理性能探秘
当前推理语言模型在英语环境下表现最强,因为英语拥有最丰富的推理训练数据。然而,推理轨迹对模型可解释性、安全性至关重要,对用户和开发者都具有实际价值。因此,开发能够按用户选择语言进行推理且保持高性能的模型成为研究目标。
研究团队以Qwen-3-Swallow-8B为基础,开发了日语推理变体模型。该模型从Qwen-3-8B持续预训练而来,采用GRPO训练方法。研究在编码、数学和科学等多个基准测试中进行评估,结果显示:通过GRPO训练持续预训练的日语模型,确实可以实现推理语言控制。
但值得注意的是,该模型在多个基准测试中的最佳表现仅与强大的英语推理基线相当。更值得关注的是,在日语文化相关基准测试中,训练后模型的性能反而低于基线模型。这表明,实现日语推理并不会自动带来文化相关任务性能的提升,推理语言的选择与特定任务性能之间存在着复杂关系。这一发现为多语言推理模型的开发提供了重要参考。