论文

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

应用与实践内容创作

摘要

当前的文本到语音系统面临着一个权衡:自回归编解码器语言模型可以产生高度可理解的语音,但需要大规模模型和训练数据并按顺序解码标记,而非自回归方法以牺牲语言准确性为代价提高速度。我们提出了 DLLM-TTS,这是一个框架,它将 TTS 制定为 X-Codec2 神经音频编解码器词元上的条件块离散扩散。该模型将序列分解为块,并在每个块内应用掩蔽扩散,同时顺序处理块,学习局部声学一致性和全局文本语音对齐。在推理过程中,块内的并行词元预测可以实现实时因子(RTF)为 0.15 的高效生成。经过 20K 小时训练的 0.6B 参数模型在 Seed-TTS-eval 基准上实现了具有竞争力的性能,证明块离散扩散语言模型能够通过并行生成实现实用且数据高效的语音合成。