首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
当前多语言大模型评测面临挑战,多数基准依赖英语数据翻译,难以反映目标语言的语言文化特性。这一问题在吉尔吉斯语等低资源语言中尤为突出,可靠的原生评估数据稀缺。基于此前发布的吉尔吉斯语评估数据集,本研究推出了首个系统性、大规模的吉尔吉斯语大模型评测基准套件KyrgyzLLM-Bench。该基准包含两个原生编写的数据集——KyrgyzMMLU和KyrgyzRC,以及经过精心翻译和人工校对的WinoGrande、HellaSwag、BoolQ和TruthfulQA版本。研究团队在零样本和少样本设置下评估了26个开源与闭源大模型,分析了模型性能、跨语言迁移以及翻译痕迹对评估可靠性的影响。结果显示,在WinoGrande和BoolQ任务上,模型排名从英语到吉尔吉斯语的迁移较为一致,MMLU次之,而HellaSwag则表现出显著的英吉性能差距,这与翻译导致的合理性偏移有关。少样本提示对部分开源模型在阅读理解任务上有提升,但对闭源模型在翻译任务上的表现不一致。所有数据集、评估代码及模型结果均已公开,并集成至广泛使用的多语言评估框架中,以支持未来吉尔吉斯语自然语言处理研究。