渐进式代码切换:低成本实现多语言推理能力迁移
当前大语言模型在英语推理任务上表现出色,但在其他语言上的推理能力往往显著下降。传统迁移方法通常需要依赖更强模型的推理轨迹蒸馏或外部评判模型的在线监督,成本高昂且难以扩展。近日,研究团队提出名为“渐进式代码切换”(PCS)的高效迁移框架,仅需轻量翻译即可实现多语言推理能力迁移。
PCS首先通过将部分英语推理步骤翻译为目标语言,构建代码混合的推理轨迹,并利用监督微调初始化模型的代码切换能力。随后,该框架采用强化学习配合分步语言一致性课程,逐步提高目标语言比例,直至模型完全使用目标语言进行推理。这种渐进式设计提供了平滑的迁移路径,避免了直接强制使用目标语言推理时常见的不稳定性和性能下降问题。
实验表明,在多个基准测试和五种类型各异的语言上,PCS显著缩小了目标语言与英语推理之间的性能差距,在保持竞争力的准确率同时,实现了更一致的多语言推理表现。该方法为资源有限场景下的多语言能力迁移提供了实用解决方案。