Freya-TTS:专为土耳其语优化的轻量级文本转语音模型发布

arXiv·8 天前

近日,研究团队在arXiv上发布了Freya-TTS技术报告,介绍了一款专为土耳其语设计的轻量级文本转语音模型。该模型采用183.2M参数的非自回归条件流匹配扩散Transformer架构,在AudioVAE2的冻结连续潜在空间中运行,能够专注于文本到潜在特征的映射,同时继承高质量的48kHz音频重建能力。

Freya-TTS在三个关键维度上实现了创新:首先,它采用基于92个土耳其语字符的无规则端到端建模,无需音素转换器、字素到音素前端或离散语音分词器;其次,通过非自回归并行去噪技术,模型能够基于预测时长同时生成整个潜在序列;第三,采用面向生产的两阶段后训练方案,包括单说话人声音锁定和短话语覆盖,显著提升了说话人一致性和短输入鲁棒性。

在Freya-TR-Eval基准测试中,Freya-TTS取得了8.0%的带匹配词错误率和3.0%的字错误率,性能优于参数规模大得多的开源系统。该模型在消费级GPU上的实时因子为0.11,在笔记本电脑CPU上也能实现超实时运行,非常适合资源受限的边缘部署场景。研究团队已根据Apache-2.0许可证开源了模型权重、训练推理代码和评估基准。

文本转语音土耳其语扩散模型轻量级模型开源

原文来源:https://arxiv.org/abs/2607.09530

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回