混合持续学习助力低资源澳大利亚原住民语言识别
语言识别是推动濒危澳大利亚原住民语言融入语音技术、支持语言复兴和数字包容的关键步骤。然而,极端的数据稀缺严重制约了模型性能。传统迁移学习方法虽能从高资源语言中学习,但在适应新语言时常遭遇灾难性遗忘问题。持续学习虽能缓解此问题,但在数据极其有限的情况下仍面临挑战。为此,研究团队提出两种混合持续学习方法:回放增强弹性权重巩固与约束引导知识蒸馏。这些方法旨在调整预训练语音模型以识别原住民语言,同时保留先前学到的知识。实验在Warlpiri、Dalabon和Dharawal三种语言上进行,结果显示,所提方法在微调和现有持续学习基线中表现更优,不仅提升了多原住民语言的适应能力,还保持了在高资源语言上的性能。这一进展为低资源语言的技术应用提供了新思路,有望促进语言保护与技术创新结合。