语音-大模型融合新思路:交错式联合训练提升语音识别性能

arXiv·18 天前

当前语音与大语言模型融合的研究在自动语音识别领域展现出潜力,但其具体优势尚未明确。研究发现,随着监督式ASR训练数据增加,LLM先验知识的贡献变得不明显,而简单的语音-文本联合训练未能充分利用文本知识。为此,研究团队提出了一种面向ASR的预训练策略——联合语音-文本交错预训练。该方法在语音-文本对齐对中构建词级和片段级的交错序列,专门适用于接受连续输入的语音-LLM架构。在3.8万小时ASR数据上的实验表明,相比仅使用ASR训练或传统联合训练基线,JSTIP方法在实体识别准确率上取得持续提升。值得注意的是,该方法使用领域转录文本即可达到与合成语音-文本对相当的实体识别性能,大大简化了领域适应过程。得益于文本预训练和领域文本数据的优势,JSTIP在医疗实体识别任务中与开源ASR及语音-LLM系统表现相当。零样本语音问答实验进一步表明,交错训练策略有效缩小了语音-文本模态差距,同时保留了大语言模型的生成先验,这可能是ASR任务中实体识别性能提升的关键原因。

语音识别大语言模型预训练方法多模态学习自然语言处理

原文来源:https://arxiv.org/abs/2607.01733

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回