论文
本地提炼,全局调度:少步文本转语音的流程图
Distill Locally, Schedule Globally: Flow Maps for Few-Step Text-to-Speech
摘要
流匹配文本到语音 (TTS) 模型可实现较高的合成质量,但需要许多神经功能评估 (NFE) 来整合其生成轨迹。最近用于 TTS 的几步流程图蒸馏方法从数值集成的教师轨迹构建目标,从而在目标准确性和训练成本之间进行权衡。我们提出局部流图蒸馏(LFMD),它将欧拉图蒸馏适应条件 TTS,并避免在目标构建过程中进行教师轨迹整合。为了进行推理,我们从教师动态和学习映射的一致性中得出采样计划(TD-DP),单个成本图支持多个 NFE 预算,而无需外部音频指标评估。由于调度在一个 NFE 中不提供灵活性,因此我们使用 soft-DTW 通过对齐感知时间自蒸馏来完善这一机制。在 Seed-TTS 和 LibriSpeech-PC 中,LFMD 在匹配的积分蒸馏基线上改进了低 NFE 合成。在 Seed-TTS 上,经过 1-NFE 训练的学生的 WER 达到 1.80%,而 32-NFE 教师的 WER 达到 1.76%。