印度语言罗马化混码基准发布,大模型跨语言指令理解面临新挑战
随着多语言社区交流日益频繁,罗马化代码混合(RCM)已成为跨语言沟通的主流形式。在这种交流模式中,双语使用者会自然地用罗马字母拼写当地语言,并与英语混合使用。然而,当前大语言模型虽然在单语和原生文字基准测试中表现出色,但其处理罗马化混合语言指令的能力尚未得到充分评估。
为此,研究团队推出了Indi-RomCoM基准测试,旨在系统评估大模型对印度语言罗马化混合指令的理解能力。该基准涵盖七项指令跟随任务、四种广泛使用的印度语言,以及三种可控的代码混合强度等级。研究团队在零样本和少样本设置下,对包括商业模型、开源权重模型和印度语言专用模型在内的一系列大语言模型进行了全面评估。
结果显示,所有测试模型在处理罗马化混合指令时表现均不理想,且随着代码混合密度的增加,性能下降更为明显。有趣的是,推理类任务(如逻辑分析)的性能下降幅度小于检测类任务(如毒性识别),这可能是因为模型生成的解释提供了必要的上下文信息。研究人员认为,Indi-RomCoM基准将有助于推动更具包容性的多语言系统开发,促进人工智能技术在多样化语言环境中的实际应用。