G-SPIN:基于图神经网络的语音识别纠错框架,精准修正关键语义错误

arXiv·26 天前

尽管自动语音识别(ASR)系统的整体词错误率已较低,但在命名实体、否定词和情感词等关键语义词汇上仍存在系统性错误。这些错误多源于语音相似性而非随机噪声,传统的词级纠错方法效果有限。

arXiv最新研究提出结构化ASR纠错框架G-SPIN,将语音图建模与上下文语言理解相结合。该框架首先通过图神经网络(GNN)为待纠错词汇构建语音相似的候选词图,将搜索空间限制在语音替代方案内;随后使用掩码语言模型(MLM)进行局部上下文评分;最后通过指令调优的大语言模型(LLM)对精简候选集进行上下文感知重排序。

这种将结构化语音推理与上下文语义选择解耦的方法,既避免了无约束生成,又提高了纠错准确性。该框架轻量模块化,完全在推理阶段运行,为ASR系统的语义准确性提升提供了新思路。

语音识别图神经网络自然语言处理纠错系统arXiv

原文来源:https://arxiv.org/abs/2606.24889

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回