论文
PilotTTS:用于竞争性语音合成的严格模块化方法
PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis
摘要
构建最先进的文本转语音 (TTS) 系统通常需要数百万小时的专有数据和复杂的多级架构,这给资源有限的研究团队带来了巨大的障碍。在本报告中,我们介绍了 PilotTTS,这是一种轻量级自回归 TTS 系统,通过简约的架构和严格的数据工程实现了具有竞争力的性能。 PilotTTS 仅接受了 20 万小时的完全使用开源工具处理的数据的训练。具体来说,我们的贡献是:(1) 一个可重复的多阶段数据处理管道,涵盖质量评估、标签注释和过滤,以及 (2) 一个紧凑的模型架构,该架构采用基于 Q-Former 的调节,通过跨样本配对训练将说话者身份与说话风格分离。在统一的框架内,PilotTTS支持零样本语音克隆、情感合成(11类)、副语言合成(4类)和汉语方言合成(14种方言)。在 Seed-TTS Eval 基准上,PilotTTS 在 test-en 上实现了 1.50% 的最低 WER,在 test-zh 上实现了 0.87% 的 CER,并且在两个测试集上实现了最高的说话人相似度(0.862 和 0.815),优于在更大的数据集上训练的系统。我们在 https://github.com/AMAPVOICE/PilotTTS 发布了完整的数据管道配方、预训练权重和代码。