论文
FlashTTS:多词元预测与均值流蒸馏加速流式语音合成
FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation
摘要
语音对话系统的最新进展要求文本转语音 (TTS) 模型更快、响应更灵敏。现代语音对话系统对 TTS 模型提出了两个主要要求:低延迟和支持流式输入和输出。然而,大多数现有的基于单码本 LLM 的 TTS 方法依赖于缺乏原生流式能力的多级管道。由于缓慢的自回归预测和多步流匹配,这些系统通常会遭受较高的端到端延迟。为了解决这些限制,我们提出了 FlashTTS,这是一种计划开源的低延迟的流式 TTS 框架。 FlashTTS 引入了一种滞后的多轨架构,可以原生处理流式文本和语音输入,从而消除了对句子级缓冲的需要。为了加速声学生成,我们将并行多词元预测 (MTP) 与 X-pred 平均流匹配解码器集成。此配置在两次函数评估 (2-NFE) 中实现了高保真 token-to-mel 生成。通过联合优化输入处理和解码效率,FlashTTS 为实时语音对话系统提供了实用基础。实验表明,与强大的流媒体基线相比,FlashTTS 将首包延迟大幅降低至 325 毫秒,同时保留了强大的零样本语音克隆和跨语言清晰度。提供语音样本。模型代码和检查点将作为开源发布。