语音-大模型融合新思路:交错式联合训练提升语音识别性能
当前语音与大语言模型融合的研究在自动语音识别领域展现出潜力,但其具体优势尚未明确。研究发现,随着监督式ASR训练数据增加,LLM先验知识的贡献变得不明显,而简单的语音-文本联合训练未能充分利用文本知识。为此,研究团队提出了一种面向ASR的预训练策略——联合语音-文本交错预训练。该方法在语音-文本对齐对中构建词级和片段级的交错序列,专门适用于接受连续输入的语音-LLM架构。在3.8万小时ASR数据上的实验表明,相比仅使用ASR训练或传统联合训练基线,JSTIP方法在实体识别准确率上取得持续提升。值得注意的是,该方法使用领域转录文本即可达到与合成语音-文本对相当的实体识别性能,大大简化了领域适应过程。得益于文本预训练和领域文本数据的优势,JSTIP在医疗实体识别任务中与开源ASR及语音-LLM系统表现相当。零样本语音问答实验进一步表明,交错训练策略有效缩小了语音-文本模态差距,同时保留了大语言模型的生成先验,这可能是ASR任务中实体识别性能提升的关键原因。