SPARCLE:让语音合成更懂说话人,低资源场景性能翻倍
在语音合成领域,传统方法通常依赖音素(phoneme)作为中间表示,但音素转换系统(G2P)难以捕捉说话人特有的声学变化。近期研究趋势转向直接基于字符(grapheme)建模,虽然在大规模数据上表现优异,但在低资源场景下仍存在局限。
arXiv最新论文提出SPARCLE模型,创新性地将字符与说话人感知的声学表示进行对齐。该模型采用对比学习目标,在训练时结合说话人身份信息,使每个字符能关联其具体的声学实现。SPARCLE本质上可替代传统G2P系统,直接为下游文本转语音(TTS)任务提供增强的字符表示。
实验显示,在极端低资源条件下,SPARCLE将语音合成的词错误率降低了一半,显著优于标准字符基线模型。这一突破为资源受限的语音合成应用提供了新的技术路径,尤其在个性化语音生成、低资源语言支持等场景具有实用价值。