论文
零样本流匹配文本到语音模型的即时一致性推理
Prompt-Consistency Inference for Zero-Shot Flow-Matching Text-to-Speech Models
摘要
近年来,流程匹配模型在零样本文本到语音合成方面取得了显着的进步。这些模型以音频提示和文本为条件,通过迭代求解 ODE 来学习速度场并生成语音。在推理过程中,求解器会演化出跨越提示和要生成的区域的单个状态,尽管最终只保留生成的区域。然而,被丢弃的提示状态仍然很重要;它的中间值通过耦合两个区域的速度场影响生成。随着采样的继续,这种状态可能会偏离规定的条件路径,从而在后续生成的更新中引入差异。与未知的生成轨迹不同,提示路径可以根据参考音频和初始噪声以闭合形式获得。我们通过提示一致性推理(PCI)来利用这一观察结果,这是一种无需训练规则,可在每次速度评估之前将提示块恢复为其分析值,同时保持生成的块不变。 PCI 提高了所评估的流匹配 TTS 骨干模型中说话人的相似度和清晰度,无需额外的网络评估。我们的消融研究进一步表明 PCI 使后步骤提示差异更小,并且覆盖后面采样阶段的校正恢复了大部分观察到的相似性增益。
