FireRedTTS3:使用语义丰富的语音表示进行统一语音生成和编辑
FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations
摘要
最近的连续自回归 TTS 模型直接对连续语音表示进行操作,保留丰富的声学细节,同时利用文本 LLM 的指令跟踪功能。这种范例为语音克隆、指令控制语音设计和语音编辑开辟了新的可能性,但在自回归生成过程中仍然容易受到错误积累的影响。现有的解决方案通常需要额外的语义模块、多级分词器训练管道或复杂的自回归架构。在这项工作中,我们提出了 FireRedTTS3,这是一种简单而有效的语音生成和编辑框架,可以减少表示级别的错误累积。具体来说,我们利用在不同语音理解任务上训练的冻结音频编码器作为语义教师来规范音频特征空间。这改进了文本语音对齐并稳定自回归生成,同时保持整个系统简单。 FireRedTTS3 提供两种变体:用于多语言和多方言零样本语音克隆的 FireRedTTS3-Base,以及用于统一语音克隆、指令控制的语音设计和语音编辑的 FireRedTTS3-Instruct。实验表明,FireRedTTS3-Base 在 Seed-TTS-Eval 和 MiniMax-MLS-Test 上的比较系统中实现了最佳的平均语音清晰度和说话人相似度,而 FireRedTTS3-Instruct 在 InstructTTSEval 和 Ming-Freeform-Audio-Edit 上优于竞争系统。这些结果表明,语义丰富的连续语音表示与简单的架构相结合,可以实现稳定、可控和高保真的语音生成和编辑。代码和模型可在 https://github.com/FireRedTeam/FireRedTTS3 获取。