论文

文本到语音合成的语音表示上的 Fréchet 距离损失

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

模型训练监督微调与指令调优

摘要

少步扩散和流匹配文本到语音 (TTS) 模型通常使用局部目标进行训练,例如条件流匹配、重建和停止预测。这些损失提供了稳定的优化,但它们从不询问采样的语音是否遵循高质量语音的分布。我们提出了语音表示 Fr'echet 距离损失 (SR-FD),这是一种用于无标记器流匹配自回归 TTS 的训练时间分布正则化器。在 微调 期间,模型使用部署时使用的相同的几步采样器合成语音,并且 SR-FD 匹配该语音的冻结 Whisper 和 CTC 特征的均值和协方差,以参考从三个互补内容目标离线计算的统计数据。该损失不需要判别器,也不需要推理时间计算。在Seed-TTS English上,四步SR-FD 微调将WER从原来四步VoxCPM2基线的2.2279%降低到1.4147%,相对降低了36.5%,并且也超过了原来十步基线的1.7366%;在话语级配对引导下,这两个增益都很显着。说话者相似性和客观质量代理保留在十步级别,错误分析显示增益来自所有提示长度的内容替换。因此,SR-FD 是一种用于少步 TTS 的可懂度改进分布正则化器。