QuechuaTok研究:黏着语分词器评估需引入形态边界准确率

arXiv·27 天前

在自然语言处理中,分词是基础但关键的预处理步骤。然而,当前主流的分词评估指标如生育率(fertility rate)在评估黏着语分词器时存在明显不足。近日,一项针对南美克丘亚语(Southern Quechua)的研究提出了QuechuaTok系统基准,专门评估不同分词策略在低资源黏着语中的表现。

克丘亚语是南美洲约800-1000万人使用的黏着语,具有丰富的形态变化。研究团队构建了包含20万句子的语料库,并采用SQUOIA有限状态形态分析器作为银标准,系统比较了BPE、Unigram LM、WordPiece和形态感知PRPE四种分词策略。

评估指标除了传统的生育率和未登录词率外,特别引入了形态边界准确率(MorphAcc)。结果显示,BPE在16k词表下获得最低生育率(1.636),但其形态边界准确率仅为6.67%,表明其通过记忆表面词形实现高效压缩,却无法正确识别形态边界。相比之下,PRPE分词器实现了83.33%的形态边界准确率,在所有系统中表现最佳。

这项研究证实,仅凭生育率等传统指标无法全面评估黏着语分词器的质量,形态边界准确率成为必要补充指标。所有代码和模型已在Kaggle平台开源,为低资源黏着语的自然语言处理研究提供了重要工具和评估框架。

分词技术低资源语言克丘亚语NLP评估黏着语处理

原文来源:https://arxiv.org/abs/2606.23943

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回