论文
X2Streaming-TTS:具有语音状态继承的流文本的因果 词元级 文本到语音转换
X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance
摘要
流式文本到语音对于低延迟口语对话系统至关重要,但许多系统等待句子级文本,因此只是伪流式传输。真正的 词元级 合成必须从不确定的前缀生成语音,同时在具有有限上下文的无界流上保持感知连续性。我们提出了 X2Streaming-TTS,这是一个因果 TTS 框架,它消耗异步到达的文本标记并发出语音,而无需访问未来的输入。为了处理不确定的前缀,我们引入了因果承诺,它通过不确定性感知缓冲使不明确的表达式保持临时状态,并执行容量自适应、标点符号感知分段。为了保持声学连续性,我们进一步引入了因果语音状态继承,它携带完整的 Code2Wav 状态和跨段边界选定的历史 Talker 状态。与注意先验约束一起,它阻止了对未来位置的访问,同时保留有界的声学背景。实验表明,X2Streaming-TTS 在大多数主观和客观指标上都优于现有的伪流模型。进一步的分析表明,因果承诺稳定了在线分割并减少了由于上下文不足而导致的失败,而语音状态继承提高了边界连续性,而不会降低自然度或说话者身份。因此,X2Streaming-TTS 实现了严格的 词元级 合成,其质量与评估的离线基线相当,单个请求的第一个音频词元 (TTFT) 的中位时间为 15.8 毫秒,128 个并发请求的中位 TTFT 为 260.8 毫秒。我们的实现可在 https://github.com/X-Square-Robot/X2Streaming-TTS 上公开获取。