英伟达Nemotron 3.5语音识别模型成功适配三种肯尼亚语言

arXiv·17 小时前

在非洲语言自动语音识别领域,研究者长期面临正字法不一致、标注伪影、音频缺失以及说话人与领域不平衡等挑战。近日,一项发表于arXiv的研究展示了如何将英伟达Nemotron 3.5 ASR Streaming 0.6B模型成功适配至基库尤语、卢奥语和卡伦津语三种肯尼亚本土语言。

研究团队从经过肯尼亚斯瓦希里语适配的检查点出发,在完整参数微调过程中保留了模型的缓存感知FastConformer RNN-T架构、提示条件机制和流式解码器。整个工程研究涵盖了语料库审计、Unicode规范化、数据分割检查、时长过滤、低速率延续、基于验证集的检查点选择、真实流式评估、伪影保留以及独立服务部署等完整流程。

在内部评估集上,经过适配的基库尤语和卢奥语模型分别取得了42.97%和33.98%的词错误率。卢奥语在冻结历史标签策略下实现了9.59%的字错误率,基库尤语的无空格字错误率更是低至7.79%。卡伦津语模型目前仍在优化中,在排除长停顿标注、数字参考和短于三个标记的目标后,其诊断子集上的词错误率为68.74%。

研究特别指出,由于使用了包含测试源数据的混合验证集进行检查点选择,卡伦津语的评分不能作为独立的泛化能力评估。团队还报告了涉及非语音标签、短话语过度生成、边界敏感词错误率以及云端任务生命周期故障等负面发现。

这项工作的核心价值在于提供了一套可审计的技术方案,展示了如何在保持流式处理约束的前提下,将多语言流式模型适配为特定语言系统,为资源有限语言的语音识别技术发展提供了重要参考。

语音识别多语言模型非洲语言Nemotron模型适配

原文来源:https://arxiv.org/abs/2607.18912

相关阅读

推理过程为何会出错?新方法让大模型自我纠偏
HPD-Parsing:文档解析新范式,实现并行解码提速3倍
印度法律问答AI系统AILQA发布,RAG框架显著提升答案质量
CASE框架:因果对齐与结构约束提升大模型思维链可信度
RF-Agent:首个面向射频电路设计的语言智能体框架问世

← 返回