论文

超越Token改写:掩码与替换扩散对零样本TTS的作用

Beyond Token Revision: Investigating Mask-and-Replace Diffusion for Zero-Shot Text-to-Speech

模型训练模型评测应用与实践预训练模型行为与机制分析语音交互与综合语音服务

摘要

与自回归模型不同,基于离散扩散的零样本文本转语音模型并行生成语音标记,并且可以重新审视早期的预测。掩码和替换训练通过随机替换一些标记来扩展仅掩码训练,其收益通常归因于自我校正,即修改先前生成的标记的能力。然而,在训练过程中暴露于随机扰动的上下文本身可能会改善生成,从而提出了这些收益是否需要推理时间Token修订的问题。为了研究这个问题,我们使用 DeMaR,它将掩码和替换训练与置信度排名的仅掩码采样相结合,同时保留总训练损坏概率。 DeMaR 在 LibriTTS 上从头开始进行训练,与使用相同语音标记器的自回归和仅掩模扩散基线相比,实现了更低的单词错误率 (WER)。当每个Token在首次被揭露后保持不变时,这种优势仍然存在。两个异构语音标记器的匹配训练条件表明,噪声上下文增强和 在此限制下,替代监督提高了 WER。这些发现证明了替换在训练方面的好处,除了支持推理时间标记修订之外。