论文

VoxCPM2 技术报告

VoxCPM2 Technical Report

应用与实践内容创作

摘要

我们提出了 VoxCPM2,这是一个 https://info.arxiv.org/help/prep#abstracts 完全开源的多语言和可控语音生成基础模型,它扩展了 VoxCPM 的分层扩散自回归建模范式。 VoxCPM2 在三个关键方面推进了该框架:(i) 能力,通过在单个骨干网内统一 30 种语言、9 种中国方言、自然语言语音设计、风格可控的语音克隆和高保真连续克隆; (ii) 质量,通过以 16 kHz 编码并以 48 kHz 重建的非对称 AudioVAE,实现隐式超分辨率和高编码效率; (iii) 扩展,将模型联合扩展为 2B 参数,并将训练数据扩展为超过 200 万小时的多语言语音。为了在一个模型中支持这些不同的功能,我们引入了一种统一的序列组织,它通过相同输入构建块的不同排列来表达所有生成模式,从而允许在一组参数和目标下进行联合训练。 VoxCPM2 在公共零样本和指令跟踪 TTS 基准测试中实现了最先进的或有竞争力的性能。在我们的内部 30 种语言评估集上,它的平均 WER 为 1.68%。这些结果表明,分层连续潜在建模在不依赖任何外部离散语音分词器的情况下,为大规模多语言和可控语音生成提供了可行且强大的基础。模型权重、微调 代码和推理工具在 Apache 2.0 许可证下公开发布,以促进社区研究和开发。