论文

Tacit-TTS:从自回归解码到屏蔽预测,实现高效的无转录语音克隆

Tacit-TTS: From Autoregressive Decoding to Masked Prediction for Efficient Transcript-Free Voice Cloning

摘要

具有自回归语义建模的 TTS 系统已展现出强大的零样本语音克隆性能和丰富的表达变化,但其顺序解码会产生大量延迟。非自回归替代方案提供更快的生成速度,但通常依赖于更严格的参考条件,例如在推理过程中需要参考语音的转录本。我们提出了 Tacit-TTS,这是一种从 IndexTTS2 中提炼出来的高效的无转录零样本语音克隆系统。我们的模型用屏蔽的非自回归生成取代了自回归文本到语义解码,引入了免训练声学长度估计,并通过 ReFlow 蒸馏加速了流匹配渲染器。在两个英语和两个普通话数据集上,Tacit-TTS 实现了具有竞争力的零样本质量,同时对于长度超过 5 秒的话语,生成语音的速度比 IndexTTS2 快 10 倍以上。其无转录条件进一步支持跨语言和非词汇引用。我们使用其他八种语言、婴儿牙牙学语和合成乱码的参考资料来验证此功能,其中依赖于转录的系统经常由于不可靠的 ASR 转录而降级或失败。