G-SPIN:基于图神经网络的语音识别纠错框架,精准修正关键语义错误
尽管自动语音识别(ASR)系统的整体词错误率已较低,但在命名实体、否定词和情感词等关键语义词汇上仍存在系统性错误。这些错误多源于语音相似性而非随机噪声,传统的词级纠错方法效果有限。
arXiv最新研究提出结构化ASR纠错框架G-SPIN,将语音图建模与上下文语言理解相结合。该框架首先通过图神经网络(GNN)为待纠错词汇构建语音相似的候选词图,将搜索空间限制在语音替代方案内;随后使用掩码语言模型(MLM)进行局部上下文评分;最后通过指令调优的大语言模型(LLM)对精简候选集进行上下文感知重排序。
这种将结构化语音推理与上下文语义选择解耦的方法,既避免了无约束生成,又提高了纠错准确性。该框架轻量模块化,完全在推理阶段运行,为ASR系统的语义准确性提升提供了新思路。