论文
DELTA-TTS:将自回归模型改编为文本转语音的扩散语言模型
DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
摘要
自回归 (AR) 文本转语音 (TTS) 模型会按顺序生成离散语音标记,这会导致推理速度变慢,并且会降低鲁棒性,因为局部错误会传播到后面的位置,并可能升级为幻觉。这种限制源于他们从左到右的 AR 承诺:必须在未来的语音标记上下文可用之前确定每个标记。然而,这种排序并不是 TTS 的固有要求,因为模型在合成之前接收完整的输入文本。在本文中,我们介绍了 DELTA-TTS,这是一种基于 LoRA 的轻量级自适应框架,可将预训练的 AR TTS 模型转换为离散扩散语言模型 (dLLM),以进行置信度排序的语音词元解码。为了更好地捕获语音的局部结构,DELTA-TTS 结合了一个注入局部声学上下文的卷积模块,以及 1/t 加权训练目标和时移推理计划,将低置信度位置推迟到后续步骤。仅在 LibriTTS 上进行了 585 小时的训练,DELTA-TTS 在 Seed-TTS test-en 上实现了 1.75% 的 WER,其性能优于其 AR 主干,同时生成词元的速度提高了 3.3 倍。进一步的分析表明,DELTA-TTS 可以产生更清晰的文本-语音对齐,提高整体解码信心,并减轻 AR 生成中观察到的幻觉。