论文

Raon-OpenTTS:开放模型和数据,实现强大的文本转语音

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech

模型训练合成数据

摘要

文本转语音 (TTS) 模型的最新进展显示出令人印象深刻的语音自然度和质量,但大规模开放数据在推动这一进展中的作用仍未得到充分探索。在这项工作中,我们介绍了 Raon-OpenTTS(一种开放式 TTS 模型,其性能可与最先进的封闭数据 TTS 模型相媲美)和 Raon-OpenTTS-Pool(一种用于可重现 TTS 训练的大规模开放数据集)。 Raon-OpenTTS-Pool 由 615K 小时的 240M 语音片段组成,这些语音片段是从公开的英语语音语料库和网络来源的录音中聚合而来的。通过将基于模型的过滤管道应用于 Raon-OpenTTS-Pool,我们衍生出 Raon-OpenTTS-Core,这是一个由 510K 小时和 194M 语音片段组成的精选高质量子集。使用 Raon-OpenTTS-Core,我们训练 Raon-OpenTTS,这是一系列基于扩散 Transformer (DiT) 的 TTS 模型,参数范围从 0.3B 到 1B。在多个基准测试中,Raon-OpenTTS-1B 显示出与 Qwen3-TTS 和 CosyVoice 3 等最先进模型相当的性能,这些模型经过数百万小时的专有语音数据训练。值得注意的是,在 Seed-TTS-Eval 上,Raon-OpenTTS-1B 的单词错误率 (WER) 为 1.78%,说话人相似度 (SIM) 为 0.749,在最近的开放权重 TTS 基线中,WER 排名第二,SIM 排名第一。在 CV3-Hard-EN 上,Raon-OpenTTS-1B 的 WER 为 6.15%,SIM 为 0.775,在这两个指标上均排名第一。此外,为了支持鲁棒性评估,我们引入了 Raon-OpenTTS-Eval,这是一个结构化基准,用于评估跨不同声学条件(包括干净、嘈杂、野外和富有表现力的语音)的 TTS 鲁棒性。在 Raon-OpenTTS-Eval 上,Raon-OpenTTS-1B 在所有评估的模型中实现了最佳的平均 WER 和 SIM,以及第二好的人类偏好(通过比较平均意见得分 (CMOS) 衡量)。我们的数据池、过滤管道、训练代码和检查点可在 https://github.com/krafton-ai/RAON-OpenTTS 上公开获取。