论文
Kongfz4-TTS:带有可学习说话人编码器的无转录跨语言零样本 TTS
Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
摘要
零样本文本转语音 (TTS) 领域的最新进展极大地提高了语音质量和语音克隆保真度。然而,许多零样本 TTS 系统在推理时仍然依赖于音频提示转录。这种依赖性限制了跨语言语音克隆,因为野外参考音频通常是未转录的。在这份技术报告中,我们介绍了Confluence4-TTS,这是一种多语言零样本TTS系统,支持14种语言,并且可以执行语言内和跨语言参考克隆,而无需音频提示的转录。孔子4-TTS遵循两阶段架构,由文本到语义(T2S)和语义到声学(S2A)模块组成。基于 LLM 的 T2S 模块使用可学习的说话人编码器从自监督语音表示中提取音色特征,条件流匹配 S2A 模块将预测的语义标记转换为梅尔频谱图。当参考转录本可用时,同一模型还支持继续克隆。 Kongfun4-TTS 在大规模多语言语音数据上进行训练。它在公共基准上实现了高清晰度和说话者相似度。在 CV3-Eval 跨语言基准测试中,Confucius4-TTS 在六个方向上的平均 WER 为 3.73%。在我们的内部跨语言集上,它在最新的开源和商业系统中实现了人类评估中最好的平均总体排名。我们在 https://github.com/netease-youdao/Confucius4-TTS 发布了代码、模型检查点和演示。