QuechuaTok研究:黏着语分词器评估需引入形态边界准确率
在自然语言处理中,分词是基础但关键的预处理步骤。然而,当前主流的分词评估指标如生育率(fertility rate)在评估黏着语分词器时存在明显不足。近日,一项针对南美克丘亚语(Southern Quechua)的研究提出了QuechuaTok系统基准,专门评估不同分词策略在低资源黏着语中的表现。
克丘亚语是南美洲约800-1000万人使用的黏着语,具有丰富的形态变化。研究团队构建了包含20万句子的语料库,并采用SQUOIA有限状态形态分析器作为银标准,系统比较了BPE、Unigram LM、WordPiece和形态感知PRPE四种分词策略。
评估指标除了传统的生育率和未登录词率外,特别引入了形态边界准确率(MorphAcc)。结果显示,BPE在16k词表下获得最低生育率(1.636),但其形态边界准确率仅为6.67%,表明其通过记忆表面词形实现高效压缩,却无法正确识别形态边界。相比之下,PRPE分词器实现了83.33%的形态边界准确率,在所有系统中表现最佳。
这项研究证实,仅凭生育率等传统指标无法全面评估黏着语分词器的质量,形态边界准确率成为必要补充指标。所有代码和模型已在Kaggle平台开源,为低资源黏着语的自然语言处理研究提供了重要工具和评估框架。