Freya-TTS:专为土耳其语优化的轻量级文本转语音模型发布
近日,研究团队在arXiv上发布了Freya-TTS技术报告,介绍了一款专为土耳其语设计的轻量级文本转语音模型。该模型采用183.2M参数的非自回归条件流匹配扩散Transformer架构,在AudioVAE2的冻结连续潜在空间中运行,能够专注于文本到潜在特征的映射,同时继承高质量的48kHz音频重建能力。
Freya-TTS在三个关键维度上实现了创新:首先,它采用基于92个土耳其语字符的无规则端到端建模,无需音素转换器、字素到音素前端或离散语音分词器;其次,通过非自回归并行去噪技术,模型能够基于预测时长同时生成整个潜在序列;第三,采用面向生产的两阶段后训练方案,包括单说话人声音锁定和短话语覆盖,显著提升了说话人一致性和短输入鲁棒性。
在Freya-TR-Eval基准测试中,Freya-TTS取得了8.0%的带匹配词错误率和3.0%的字错误率,性能优于参数规模大得多的开源系统。该模型在消费级GPU上的实时因子为0.11,在笔记本电脑CPU上也能实现超实时运行,非常适合资源受限的边缘部署场景。研究团队已根据Apache-2.0许可证开源了模型权重、训练推理代码和评估基准。