突破语言壁垒:阿拉伯语-俄语科学平行语料库与LLM基准发布
在科学交流领域,阿拉伯语和俄语作为主要语言之一,长期存在语言壁垒阻碍研究成果的传播。近日,研究人员发布了一项重要成果——阿拉伯语-俄语科学翻译基准,包含约2.7万句对的混合平行语料库,涵盖科学摘要及宗教、新闻、对话等通用领域文本。
研究团队对三个多语言大模型进行了微调实验:mT5-base(5.8亿参数)、NLLB-200-distilled-1.3B(13亿参数)和Qwen2.5-7B-Instruct(70亿参数)。实验采用LoRA技术,测试了秩为8、16、32、64的配置。结果显示,使用QLoRA(秩8)的Qwen2.5-7B模型表现最佳,BLEU得分23.15,chrF得分43.89,BERTScore得分0.906,COMET得分0.758,较零样本基线分别提升4.36 BLEU和0.051 COMET。
值得注意的是,使用三个示例的少样本提示并未提升性能,表明领域特定的微调至关重要。该研究已开源模型、语料库和评估代码,通过降低科学文本的语言障碍,促进阿拉伯语和俄语研究社区的知识交流,支持联合国可持续发展目标中的伙伴关系(SDG 17)和创新基础设施(SDG 9),符合技术驱动可持续发展的会议主题。