论文

X-Voice:通过零镜头跨语言语音克隆让每个人都能说 30 种语言

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

应用与实践内容创作

摘要

在本文中,我们提出了 X-Voice,这是一种 0.4B 多语言零样本语音克隆模型,可以克隆任意语音并使每个人都能说 30 种语言。 X-Voice 在 42 万小时的多语言语料库上进行训练,使用国际音标 (IPA) 作为统一表示。为了消除对提示文本的依赖,而不需要像强制对齐这样的复杂预处理,我们设计了一个两阶段的训练范例。在第一阶段,我们通过标准条件流匹配训练建立X-Voice$_{\text{s1}}$,并用它来合成10K小时的说话人一致片段作为音频提示。在第 2 阶段,我们对这些音频对进行微调,并屏蔽提示文本以派生 X-Voice$_{\text{s2}}$,这可以实现零样本语音克隆,而无需音频提示的转录。在架构上,我们通过实现语言标识符的双层注入以及无分类器指导的解耦和调度来扩展 F5-TTS,以促进多语言语音合成。主客观评估结果表明,X-Voice 的性能优于 LEMAS-TTS 等现有基于流程匹配的多语言系统,并实现了与 Qwen3-TTS 等十亿级模型相当的零样本跨语言克隆能力。为了促进研究透明度和社区进步,我们开源所有相关资源。