论文
Qwen-Audio-3.0-TTS:具有多阶段训练范式的自由可控且高度鲁棒的语音合成
Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm
摘要
在本报告中,我们提出了 Qwen-Audio-3.0-TTS,这是一种面向生产的语音合成系统,可共同提高内容一致性、说话者相似度、韵律自然度、音频质量、可控性、多语言覆盖、效率和鲁棒性。它将用于减少推理延迟的 12.5Hz 低帧率语音标记器与用于协调语言模型 (LM) 和流匹配模型 (FM) 优化的五阶段渐进训练范例相结合。该模型通过自由式自然语言指令和细粒度内联标签提供生产级控制,同时支持 16 种语言、20 个中国方言区域、长达 3 分钟的一次性长格式合成,以及从嘈杂、混响或不清楚的参考语音中稳健生成。在 SEED-TTS-Eval、CV3-Eval、指令遵循、长格式和声学鲁棒性评估中,Qwen-Audio-3.0-TTS 在许多报告的维度或最强的总体结果上实现了最先进的性能。它还在独立的人工分析文本转语音排行榜上排名第一。这些结果为 Qwen-Audio-3.0-TTS 奠定了生产级语音合成的坚实基础。