Transformer模型在古兰经语音识别中的性能对比研究
古兰经自动语音识别(ASR)技术致力于将诵读音频转换为文本,可用于辅助记忆工具和经文搜索引擎等应用。然而现有ASR模型在用户诵读场景下词错误率较高,且对古兰经全文本覆盖不足。
近期研究团队通过系统性实证研究,探索了基于Transformer的预训练模型在古兰经ASR任务中的领域适应性微调。研究采用Wav2Vec2.0、HuBERT和XLS-R三种先进语音特征提取方法,这些模型通过掩码部分输入音频并利用Transformer架构学习上下文感知的语音特征。
研究使用超过870小时的专业及用户诵读数据集进行微调,涵盖过滤后的古兰经语音数据。通过特征提取器、输出标签格式、训练策略和音频片段时长等多维度消融实验,揭示了影响该领域转录准确性的关键因素。
实验结果显示:最佳配置在EveryAyah子集上词错误率降至0.08,在混合数据集上达到0.11,较基线模型Citrinet(WER=0.163)提升约5个百分点,同时将训练时间从140小时压缩至40小时。研究还发现无变音符号的阿拉伯文本微调效果最优,Wav2Vec2-XLSR-53模型展现出最强的整体表征能力。未来研究方向包括提升数据集质量,开发音素感知模型以获取更深层语音特征,满足泰吉威德诵读规则敏感型应用需求。