ASR评测新思路:双重参考基准揭示非典型语音识别盲区

arXiv·20 天前

自动语音识别(ASR)系统在非典型语音(如口吃、发音障碍等)上的表现往往不尽如人意。最新研究发现,这背后隐藏着一个长期被忽视的关键问题:非典型语音实际上存在两种有效的转录参考标准——逐字转录(记录实际发出的语音,包括重复、延长等不流畅现象)和意图转录(去除不流畅部分后的规范文本形式)。当前大多数ASR评估体系将这两种标准混为一谈,仅采用单一标准作为基准,导致系统倾向于删除不流畅部分,却牺牲了对原始语音的忠实度。

研究团队以口吃语音为案例,对11个来自编码器-解码器、CTC和转换器架构的ASR模型进行了双重参考基准测试。定量分析显示,使用不同转录标准时,模型的表现和排名存在显著差异。这一发现凸显了根据具体应用场景选择合适的转录参考标准的重要性,特别是在非典型语音识别领域。该研究不仅为ASR评测提供了更科学的框架,也为开发更具包容性的语音技术指明了方向。

语音识别ASR评测非典型语音人工智能伦理学术研究

原文来源:https://arxiv.org/abs/2606.31112

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回