ASR评测新思路:双重参考基准揭示非典型语音识别盲区
自动语音识别(ASR)系统在非典型语音(如口吃、发音障碍等)上的表现往往不尽如人意。最新研究发现,这背后隐藏着一个长期被忽视的关键问题:非典型语音实际上存在两种有效的转录参考标准——逐字转录(记录实际发出的语音,包括重复、延长等不流畅现象)和意图转录(去除不流畅部分后的规范文本形式)。当前大多数ASR评估体系将这两种标准混为一谈,仅采用单一标准作为基准,导致系统倾向于删除不流畅部分,却牺牲了对原始语音的忠实度。
研究团队以口吃语音为案例,对11个来自编码器-解码器、CTC和转换器架构的ASR模型进行了双重参考基准测试。定量分析显示,使用不同转录标准时,模型的表现和排名存在显著差异。这一发现凸显了根据具体应用场景选择合适的转录参考标准的重要性,特别是在非典型语音识别领域。该研究不仅为ASR评测提供了更科学的框架,也为开发更具包容性的语音技术指明了方向。