跨语言迁移研究新发现:任务对齐比语言亲缘关系更重要
一项发表于arXiv的最新研究对跨语言迁移机制提出了新见解。研究团队对7个参数量在40亿至6710亿之间的大语言模型进行了阿拉伯语微调,并在闪米特语系和非闪米特语系语言上进行了零样本阅读理解测试。实验涵盖了密集型和混合专家两种主流架构。
令人意外的是,研究未发现任何闪米特语系特有的迁移优势。基线表现较弱的模型在所有语言上都取得了显著提升,而基线较强的模型无论面对何种语系语言,改善幅度都很有限。研究进一步通过思维链消融实验验证了这一发现:从微调中获益最多的模型,在推理时使用思维链也能获得同等程度的提升。
这一系列结果表明,当前大语言模型的跨语言能力提升主要源于任务格式的对齐优化,而非真正的跨语言知识迁移。研究为理解多语言大模型的工作机制提供了重要参考,提示未来研究应更关注任务适配性而非单纯依赖语言相似性假设。