论文

LongCat-AudioDiT:波形潜在空间中的高保真扩散文本转语音

LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space

应用与实践内容创作

摘要

我们提出了 LongCat-AudioDiT,这是一种新颖的、基于非自回归扩散的文本转语音 (TTS) 模型,可实现最先进的 (SOTA) 性能。与之前依赖中间声学表示(例如梅尔频谱图)的方法不同,LongCat-AudioDiT 的核心创新在于直接在波形潜在空间内进行操作。这种方法有效地减轻了复合错误并极大地简化了 TTS 管道,仅需要波形变分自动编码器 (Wav-VAE) 和扩散骨干网。此外,我们对推理过程进行了两项关键改进:首先,我们识别并纠正了长期存在的训练与推理不匹配的问题;其次,我们用自适应投影引导取代传统的无分类器引导,以提高生成质量。实验结果表明,尽管缺乏复杂的多阶段训练流程或高质量的人工注释数据集,LongCat-AudioDiT 在 Seed 基准上实现了 SOTA 零样本语音克隆性能,同时保持了有竞争力的清晰度。具体来说,我们最大的变体 LongCat-AudioDiT-3.5B 优于之前的 SOTA 模型 (Seed-TTS),将 Seed-ZH 上的说话人相似度 (SIM) 分数从 0.809 提高到 0.818,将 Seed-Hard 上的说话者相似度 (SIM) 分数从 0.776 提高到 0.797。最后,通过全面的消融研究和系统分析,我们验证了我们提出的模块的有效性。值得注意的是,我们研究了 Wav-VAE 和 TTS 主干之间的相互作用,揭示了一个违反直觉的发现,即 Wav-VAE 中出色的重建保真度并不一定会带来更好的整体 TTS 性能。代码和模型权重的发布是为了促进语音界的进一步研究。