论文
WavTTS:通过直接原始波形建模实现高质量零射击 TTS
WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling
摘要
最近,在 VAE 潜伏或梅尔谱图上运行的扩散模型已成为零样本 TTS 的主导范例。尽管这些压缩表示提高了生成效率,但它们不可避免地会遭受信息丢失和非端到端训练的困扰。理论上,直接对原始波形进行建模可以避免这些问题;然而,由于音频信号的序列长度极长,这个方向仍未得到充分探索,并且通常被认为是困难的。为了克服这个问题,我们提出了 WavTTS,这是第一个原始波形生成 TTS 模型,它大大缩小了与潜在空间生成模型的差距。 WavTTS 基于与 Diffusion Transformer (DiT) 的流程匹配而构建,通过简单的补丁策略直接对语音波形进行建模,同时集成多尺度梅尔频谱图监督以在训练期间提供感知指导。此外,我们研究了预测目标和噪声调度对波形扩散的影响,并开发了有效的调度设计来提高生成质量。对开源基准的评估表明,WavTTS 非常接近当前最先进的潜在生成零样本 TTS 模型的性能,同时大大优于以前的端到端语音生成模型。我们的研究结果证明了直接在波形空间中扩展基于扩散的 TTS 的可行性,为端到端语音生成开辟了新方向。