论文

跨语言 F5-TTS 2:与语言无关的语音克隆的简化框架

Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning

模型训练合成数据

摘要

零样本文本转语音 (TTS) 可以从简短的音频提示中克隆说话者的声音,但大多数 TTS 系统在推理过程中仍然需要音频提示转录。当音频提示转录不可用时,这种依赖性可以防止跨语言语音克隆,特别是对于看不见的语言。跨语言 F5-TTS 消除了这种依赖性,并实现了无转录的跨语言语音克隆,但它通过强制对齐来准备训练数据。强制对齐对边界错误很敏感,并且随着覆盖的语言增多,其成本也会增加。当音频提示以静音开始或结束时,其语速预测器在估计持续时间时也不可靠。在本文中,我们提出了跨语言 F5-TTS 2,这是一个无需强制对齐的无转录跨语言语音克隆的简化框架。我们没有使用强制对齐来分割真实的话语,而是使用预训练的 F5-TTS 模型构建同说话者提示和目标对,并在这些构建的对上微调相同的模型。这简化了数据准备并保留了预训练模型的声学建模能力,只需短暂的微调阶段即可实现适应。我们通过沉默感知增强进一步使音节级语速预测器对前导和尾随沉默具有鲁棒性。实验表明,Cross-Lingual F5-TTS 2 在保持清晰度的同时,比 F5-TTS 和 Cross-Lingual F5-TTS 具有更高的说话人相似度。所有相关资源都是公开的。