词汇表移植技术:解决孟加拉语轻量语音识别中的自回归崩溃问题

arXiv·8 天前

在边缘设备上部署轻量级语音识别模型面临诸多挑战,尤其是对于孟加拉语这类形态丰富的非拉丁语系语言。最新研究发现,像Moonshine这类高度优化的架构在孟加拉语识别任务中表现不佳,其根本原因在于模型采用的英语中心化字节级分词器。这种分词器会将孟加拉语词汇拆分成高生育率的字节链,导致推理过程中出现灾难性的自回归崩溃现象。

为解决这一问题,研究团队提出了一种新颖的词汇表移植流程。该方法将解码器词汇表替换为原生孟加拉语BanglaBERT的WordPiece词汇表,并相应调整标记嵌入矩阵的尺寸。实验结果显示,该方法将标记生育率从9.16大幅降低至1.30,自回归序列长度减少了85.8%,完全消除了解码不稳定性。

在882小时的Lipi-Ghor数据集上进行评估时,改进后的架构实现了21.54%的词错误率和0.0053的实时因子,表现出色。这项研究为紧凑型语音识别模型的跨文字适应提供了一个可扩展、可复现的解决方案,无需进行资源密集的预训练过程,为边缘设备上的多语言语音识别应用开辟了新途径。

语音识别边缘计算多语言处理自然语言处理模型优化

原文来源:https://arxiv.org/abs/2607.09598

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回