论文

dots.tts 技术报告

dots.tts Technical Report

应用与实践内容创作

摘要

我们提出了dots$.$tts,这是一种 2B 参数连续自回归文本到语音 (TTS) 基础模型,可对连续潜在空间中的语音进行建模。与现有的连续自回归模型相比,我们的关键创新有三个。首先,我们训练具有多个目标的 AudioVAE,以构建语义结构化且预测友好的连续语音空间。其次,我们在流量匹配头中使用全历史调节来保持远程一致性并减少生成过程中的漂移。第三,我们将无奖励自校正后训练应用于流量匹配头,以进一步提高稳健性和音质。经过大规模多语言语料库的训练后,dots$.$tts在Seed-TTS-Eval上取得了最好的平均性能,在zh/en/zh-hard测试集上的WER分别为0.94%/1.30%/6.60%,SIM分数分别为81.0/77.1/79.5。在其他基准测试中,dots$.$tts 也始终展现出最先进的开源性能,表现出强大的生成稳定性、语音克隆能力和情感表达能力。为了高效推理,我们进一步应用 CFG 感知的 MeanFlow 蒸馏,在输出流和双流模式下分别实现低延迟语音生成,第一个数据包延迟为 85/54 ms。为了促进可重复的研究和实际部署,我们在 Apache 2.0 许可证下发布了训练和推理代码,以及预训练、后训练和 MeanFlow 蒸馏检查点。