突破语言壁垒:阿拉伯语-俄语科学平行语料库与LLM基准发布

arXiv·20 天前

在科学交流领域,阿拉伯语和俄语作为主要语言之一,长期存在语言壁垒阻碍研究成果的传播。近日,研究人员发布了一项重要成果——阿拉伯语-俄语科学翻译基准,包含约2.7万句对的混合平行语料库,涵盖科学摘要及宗教、新闻、对话等通用领域文本。

研究团队对三个多语言大模型进行了微调实验:mT5-base(5.8亿参数)、NLLB-200-distilled-1.3B(13亿参数)和Qwen2.5-7B-Instruct(70亿参数)。实验采用LoRA技术,测试了秩为8、16、32、64的配置。结果显示,使用QLoRA(秩8)的Qwen2.5-7B模型表现最佳,BLEU得分23.15,chrF得分43.89,BERTScore得分0.906,COMET得分0.758,较零样本基线分别提升4.36 BLEU和0.051 COMET。

值得注意的是,使用三个示例的少样本提示并未提升性能,表明领域特定的微调至关重要。该研究已开源模型、语料库和评估代码,通过降低科学文本的语言障碍,促进阿拉伯语和俄语研究社区的知识交流,支持联合国可持续发展目标中的伙伴关系(SDG 17)和创新基础设施(SDG 9),符合技术驱动可持续发展的会议主题。

多语言大模型机器翻译平行语料库科学交流可持续发展

原文来源:https://arxiv.org/abs/2606.30943

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回