论文
基于离散词元 LLM 的 TTS 系统的端到端训练
End-to-End Training for Discrete Token LLM based TTS System
摘要
最近最先进的 (SOTA) 文本转语音 (TTS) 系统通常采用由语音分词器、自回归 大语言模型 (LLM) 和基于扩散的流匹配 (FM) 模型组成的级联管道,这些组件都是独立训练的。在本文中,我们提出了一个完全端到端(E2E)的优化框架,该框架统一了语音标记器、LLM、FM 模型和附加奖励模型(RM)的训练。具体来说,我们首先使用源自 FM 重建的多任务目标、LLM 的下一个标记预测和 RM 的多识别任务来联合优化标记器。这种联合训练鼓励离散语音标记空间捕获更适合 TTS 的声学和语义显着信息。然后,我们使用 FM 和 RM 的下游重建和识别进一步优化 LLM,这减少了推理时间不匹配并引导 LLM 走向更优选的世代。实验结果表明,我们的 E2E 框架始终优于级联基线。在 Seed-TTS-Eval 基准测试中,我们的系统实现了 0.78% 和 1.56% 的字错误率 (WER),这是使用 0.6B 参数 LLM 和 0.5B 参数 FM 模型的新 SOTA 结果。这些结果验证了整体 E2E 优化对于通过更简单的训练管道改进基于离散词元的 TTS 系统至关重要。