首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战

arXiv·9 小时前

当前多语言大模型评测面临挑战,多数基准依赖英语数据翻译,难以反映目标语言的语言文化特性。这一问题在吉尔吉斯语等低资源语言中尤为突出,可靠的原生评估数据稀缺。基于此前发布的吉尔吉斯语评估数据集,本研究推出了首个系统性、大规模的吉尔吉斯语大模型评测基准套件KyrgyzLLM-Bench。该基准包含两个原生编写的数据集——KyrgyzMMLU和KyrgyzRC,以及经过精心翻译和人工校对的WinoGrande、HellaSwag、BoolQ和TruthfulQA版本。研究团队在零样本和少样本设置下评估了26个开源与闭源大模型,分析了模型性能、跨语言迁移以及翻译痕迹对评估可靠性的影响。结果显示,在WinoGrande和BoolQ任务上,模型排名从英语到吉尔吉斯语的迁移较为一致,MMLU次之,而HellaSwag则表现出显著的英吉性能差距,这与翻译导致的合理性偏移有关。少样本提示对部分开源模型在阅读理解任务上有提升,但对闭源模型在翻译任务上的表现不一致。所有数据集、评估代码及模型结果均已公开,并集成至广泛使用的多语言评估框架中,以支持未来吉尔吉斯语自然语言处理研究。

大模型评测多语言NLP低资源语言基准数据集跨语言迁移

原文来源:https://arxiv.org/abs/2607.17173

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架
BLAD数据集发布:覆盖1799-2025年孟加拉国多语言法律文本

← 返回