论文

DriftTTS:分布匹配漂移实现免蒸馏少步TTS

DriftTTS: Few-Step Text-to-Speech Without Distillation via Distribution-Matching Drift

应用与实践语音交互与综合语音服务

摘要

少步神经文本到语音模型常依赖缩短的扩散或流匹配排程,或从预训练多步教师蒸馏。为避免这些依赖,我们提出DriftTTS——无生成式教师、无蒸馏、无对抗判别训练的少步梅尔谱生成器:在由原始梅尔与同一LJSpeech训练划分预训练的冻结掩码自编码器编码器定义的梅尔域特征空间中使用分布匹配漂移目标;在策略rollout训练解码器于自身中间状态上,支持至所训rollout深度的推理。LJSpeech上DriftTTS在NFE=4达3.87 dB MCD与3.7% WER(Matcha-TTS为3.85 dB与3.4%);完全配对的盲听测试中DriftTTS取得4.18 MOS(Matcha-TTS 3.96、真值4.22)。结果证明无需预训练生成式教师的竞争性少步合成。