SPARCLE:让语音合成更懂说话人,低资源场景性能翻倍

arXiv·18 天前

在语音合成领域,传统方法通常依赖音素(phoneme)作为中间表示,但音素转换系统(G2P)难以捕捉说话人特有的声学变化。近期研究趋势转向直接基于字符(grapheme)建模,虽然在大规模数据上表现优异,但在低资源场景下仍存在局限。

arXiv最新论文提出SPARCLE模型,创新性地将字符与说话人感知的声学表示进行对齐。该模型采用对比学习目标,在训练时结合说话人身份信息,使每个字符能关联其具体的声学实现。SPARCLE本质上可替代传统G2P系统,直接为下游文本转语音(TTS)任务提供增强的字符表示。

实验显示,在极端低资源条件下,SPARCLE将语音合成的词错误率降低了一半,显著优于标准字符基线模型。这一突破为资源受限的语音合成应用提供了新的技术路径,尤其在个性化语音生成、低资源语言支持等场景具有实用价值。

语音合成低资源学习对比学习arXivTTS

原文来源:https://arxiv.org/abs/2607.01238

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回