论文

S5-TTS:有限前瞻下的流式语音合成

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

应用与实践内容创作

摘要

级联 LLM-TTS 系统中的流式文本到语音合成仍然面临延迟挑战,因为大多数 TTS 模型在开始生成之前需要完整的上下文。我们提出了 S5-TTS,它是 T5-TTS 的流式变体,它通过编码器-解码器语言建模和单调对齐学习实现低延迟、逐词增量语音合成。 S5-TTS 在收到前几个单词后立即开始生成语音,从而大大减少端到端响应延迟。为了在有限的前瞻下保持质量,我们引入了一种前瞻因果掩蔽机制,该机制具有基于 Conv 的辅助注意力,可保留清晰度和说话者相似性,并采用交错多源 蒸馏 来进一步恢复自然度。实验表明,S5-TTS 的质量可与全上下文 T5-TTS 相当,支持具有高说话人相似度的零样本合成,并显着降低实际对话 AI 系统的端到端延迟。