论文

CuteTTS:通过连续潜在变量的自回归建模实现高效、高质量的语音合成

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

摘要

零镜头文本转语音 (TTS) 现在支持交互式助手、个性化媒体和辅助工具。所有 TTS 系统都需要忠实的语言渲染、一致的说话者身份和低延迟响应。然而,紧凑的流系统必须在可预测的低速率潜在序列中保留足够的声学细节,而迭代扩散采样和无分类器引导会在每个自回归步骤中增加推理成本。为了在高保真合成和低延迟推理之间取得平衡,我们推出了 CuteTTS,一种紧凑的连续自回归 TTS 系统。它将语义对齐的因果 VAE 潜伏与补丁级自回归、显式说话人调节和双向流匹配头相结合。我们进一步引入指导步骤 蒸馏,它将无分类器指导和多个求解器步骤吸收到单个区间条件学生中。对 LibriSpeech 和 Seed-TTS-Eval 的评估表明,在零样本语音克隆中具有竞争性的清晰度和说话人相似性,而相对于具有可比客观和主观质量的基本模型,蒸馏 将第一音频延迟降低了 23.3%,实时因素降低了 40.8%。这些结果为实现连续自回归 TTS 提供了一条实用途径,可协调高保真生成与实时交互的延迟需求。