论文

LLaDA-TTS:通过掩模扩散建模统一语音合成和零样本编辑

LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling

应用与实践内容创作

摘要

基于 大语言模型 (LLM) 的文本转语音 (TTS) 系统通过自回归 (AR) 解码实现了显着的自然度,但需要 N 个连续步骤来生成 N 个语音标记。我们提出了 LLaDA-TTS,它用掩码扩散模型取代了 AR LLM,该模型以固定数量的并行步骤完成生成,从而将推理延迟与序列长度解耦。值得注意的是,仅使用 50 小时的 微调 数据,我们就通过双向注意力成功地将预训练的 AR 检查点转移到掩模扩散范例。通过 64 个步骤,LLaDA-TTS 在 Seed-TTS-Eval 上实现了 0.98% CER (zh) 和 1.96% WER (en),与原始 CosyVoice 3 基线性能相匹配,同时提供了 2 倍 LLM 级加速——尽管没有 KV 缓存(AR 基线严重依赖的优化),但仍实现了显着的加速。除了加速之外,双向架构自然可以实现零次语音编辑,包括单词级插入、删除和替换,而无需任何额外的训练。理论上,我们证明 AR 预训练权重在声学标记的局部性属性下对于双向屏蔽预测来说是接近最优的,这解释了这种快速收敛。这种通用方法仅修改注意力掩模和目标,无缝应用于任何基于 LLM 的 AR TTS 系统。代码和音频示例将在 https://deft-piroshki-b652b5.netlify.app/ 上提供。