论文

EditVoice:使用编辑流程进行可变长度非自回归零样本 TTS 和语音编辑

EditVoice: Variable-Length Non-Autoregressive Zero-Shot TTS and Speech Editing with Edit Flows

模型推理解码与生成控制

摘要

最近的非自回归 (NAR) 零样本文本转语音 (TTS) 模型是并行生成的,但通常需要在生成之前指定目标序列长度。我们引入了 EditVoice,据我们所知,这是第一个可变长度 NAR 零样本 TTS 模型,它使用编辑流通过插入、删除和替换来联合更新语音内容和序列长度。 EditVoice采用语音填充训练,将零样本TTS和基于文本的语音编辑相结合,并允许在推理时放置前缀和后缀语音提示。我们引入互补提示采样(CPS)来利用由两个提示放置引起的互补编辑流预测。我们进一步发现 EditVoice 可以编辑训练源之外的源语音和模型生成的语音。我们使用这种概括进行端到端编辑和免训练的生成后细化。通过在 GigaSpeech 上训练 10K 小时的编辑流模型,EditVoice 在 Seed-TTS Eval EN 和 LibriSpeech-PC 上展示了具有竞争力的零样本 TTS 性能,并在 RealEdit 上展示了语音编辑性能。