混合持续学习助力低资源澳大利亚原住民语言识别

arXiv·6 天前

语言识别是推动濒危澳大利亚原住民语言融入语音技术、支持语言复兴和数字包容的关键步骤。然而,极端的数据稀缺严重制约了模型性能。传统迁移学习方法虽能从高资源语言中学习,但在适应新语言时常遭遇灾难性遗忘问题。持续学习虽能缓解此问题,但在数据极其有限的情况下仍面临挑战。为此,研究团队提出两种混合持续学习方法:回放增强弹性权重巩固与约束引导知识蒸馏。这些方法旨在调整预训练语音模型以识别原住民语言,同时保留先前学到的知识。实验在Warlpiri、Dalabon和Dharawal三种语言上进行,结果显示,所提方法在微调和现有持续学习基线中表现更优,不仅提升了多原住民语言的适应能力,还保持了在高资源语言上的性能。这一进展为低资源语言的技术应用提供了新思路,有望促进语言保护与技术创新结合。

持续学习语言识别低资源语言澳大利亚原住民语言语音模型

原文来源:https://arxiv.org/abs/2607.11946

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回