论文

零样本流匹配文本到语音模型的即时一致性推理

Prompt-Consistency Inference for Zero-Shot Flow-Matching Text-to-Speech Models

模型推理解码与生成控制

摘要

近年来,流程匹配模型在零样本文本到语音合成方面取得了显着的进步。这些模型以音频提示和文本为条件,通过迭代求解 ODE 来学习速度场并生成语音。在推理过程中,求解器会演化出跨越提示和要生成的区域的单个状态,尽管最终只保留生成的区域。然而,被丢弃的提示状态仍然很重要;它的中间值通过耦合两个区域的速度场影响生成。随着采样的继续,这种状态可能会偏离规定的条件路径,从而在后续生成的更新中引入差异。与未知的生成轨迹不同,提示路径可以根据参考音频和初始噪声以闭合形式获得。我们通过提示一致性推理(PCI)来利用这一观察结果,这是一种无需训练规则,可在每次速度评估之前将提示块恢复为其分析值,同时保持生成的块不变。 PCI 提高了所评估的流匹配 TTS 骨干模型中说话人的相似度和清晰度,无需额外的网络评估。我们的消融研究进一步表明 PCI 使后步骤提示差异更小,并且覆盖后面采样阶段的校正恢复了大部分观察到的相似性增益。

零样本流匹配文本到语音模型的即时一致性推理的原论文方法或结果图
图 1:LibriSpeech-PC 测试清理(带或不带 PCI)上的 ZipVoice-Distill(8 NFE)的提示漂移和生成块参考路径差异。在每个欧拉步骤之后、任何后续的即时修正之前进行测量。曲线显示平均值,阴影带表示不同话语之间的一个标准差。