Mamba模型在南非多语言语音识别中的表现评估
近期自动语音识别(ASR)领域的研究探索了多种序列模型,包括基于Conformer的模型和新兴的状态空间模型如Mamba。尽管先前工作已在多种语言中评估了这些架构,但它们在非洲语言中的有效性仍缺乏充分探索。
本研究针对七种南非语言评估了Mamba模型在ASR任务中的表现。在单语言实验中,每个模型使用每种语言50小时的语音数据进行训练,并将Mamba与参数规模相近的Conformer基线模型进行比较。结果显示,Mamba在达到与Conformer相似识别准确率的同时,使用了更少的计算资源且训练速度更快。研究还发现,两种模型在处理比训练数据更长的语音时都面临泛化困难。
在多语言ASR实验中,研究团队以将所有语言数据合并训练为基线,测试了三种扩展方法:通过添加语言和语系嵌入作为下采样声学表示的偏置来融入语系信息;以及使用CTC ASR目标和语言识别(LID)头进行多任务学习。研究发现,多语言训练始终优于单语言训练,但添加显式语言信息并未提升域内性能,却增强了跨语料库的鲁棒性。
在低资源多语言设置下(每种语言5小时和10小时训练数据)的消融研究表明,使用语言嵌入能带来性能提升,移除或修改这些嵌入会损害模型表现。进一步分析显示,这些嵌入并未捕捉类型学意义上的语言相似性,而是充当任务特定的控制向量。