Transformer模型在古兰经语音识别中的性能对比研究

arXiv·31 天前

古兰经自动语音识别(ASR)技术致力于将诵读音频转换为文本,可用于辅助记忆工具和经文搜索引擎等应用。然而现有ASR模型在用户诵读场景下词错误率较高,且对古兰经全文本覆盖不足。

近期研究团队通过系统性实证研究,探索了基于Transformer的预训练模型在古兰经ASR任务中的领域适应性微调。研究采用Wav2Vec2.0、HuBERT和XLS-R三种先进语音特征提取方法,这些模型通过掩码部分输入音频并利用Transformer架构学习上下文感知的语音特征。

研究使用超过870小时的专业及用户诵读数据集进行微调,涵盖过滤后的古兰经语音数据。通过特征提取器、输出标签格式、训练策略和音频片段时长等多维度消融实验,揭示了影响该领域转录准确性的关键因素。

实验结果显示:最佳配置在EveryAyah子集上词错误率降至0.08,在混合数据集上达到0.11,较基线模型Citrinet(WER=0.163)提升约5个百分点,同时将训练时间从140小时压缩至40小时。研究还发现无变音符号的阿拉伯文本微调效果最优,Wav2Vec2-XLSR-53模型展现出最强的整体表征能力。未来研究方向包括提升数据集质量,开发音素感知模型以获取更深层语音特征,满足泰吉威德诵读规则敏感型应用需求。

语音识别Transformer古兰经Wav2Vec2领域适应

原文来源:https://arxiv.org/abs/2606.19747

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回