论文

Faster IndexTTS-2:在 GPU 上加速和流式传输自回归零样本文本到语音合成

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

AI 基础设施模型部署

摘要

自回归文本转语音模型具有很强的自然性,但由于顺序词元生成而导致推理缓慢,限制了它们在需要低延迟的生产应用程序中的部署。 IndexTTS-2 是最先进的自回归 TTS 模型,由 GPT、流匹配 Diffusion Transformer 和声码器组成。尽管合成质量很高,但如果没有流或批处理支持,其推理速度几乎无法达到实时。我们推出了 Faster IndexTTS-2,它可以加速 IndexTTS-2 的所有神经网络组件,以便使用 NVIDIA TensorRT 和 TensorRT-LLM 在 GPU 上进行生产部署。 Faster IndexTTS-2 还支持对延迟敏感的交互式应用程序的流合成,并跨所有组件进行批量推理,以最大限度地提高 GPU 利用率。英语和中文 Seed-TTS 基准测试表明,自回归 GPT 加速高达 5.0$\times$,端到端加速高达 3.6$\times$,而单词错误率、说话者相似度和自然度的降低最小。我们的方法为在 GPU 上高效加速类似的自回归语音模型提供了实用参考。