语言相似性助力极低资源语音识别:Warlpiri 语言研究
在自动语音识别(ASR)领域,极低资源语言的识别一直面临挑战。近日,一项发表于 arXiv 的研究聚焦于澳大利亚原住民语言 Warlpiri,该语言转录语音数据极为匮乏,依赖迁移学习成为关键。研究团队提出了一种创新框架,整合了来自预训练语音模型的声学相似性,以及基于类型学、音素库、语法和句法特征的语言学相似性,以此对高资源源语言进行排序,并评估它们向 Warlpiri 迁移 ASR 的效果。实验采用 Whisper 模型进行,结果显示,声学和类型学相似的语言在性能上显著优于单语和多语基线模型。具体而言,阿萨姆语和印地语在词错误率和字符错误率上实现了大幅降低。进一步的相关性分析表明,声学相似性是微调性能的最强预测指标,而音素库和类型学相似性则更好地解释了零样本迁移的效果。这项研究为低资源语言的语音识别提供了实用的方法论参考,强调了跨语言迁移中多维相似性的重要性。