论文

OmniVoice:利用扩散语言模型实现全语言零样本文本转语音

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

应用与实践内容创作

摘要

我们推出了 OmniVoice,这是一种大规模多语言零样本文本转语音 (TTS) 模型,可扩展到 600 多种语言。其核心是一种新颖的扩散语言模型风格的离散非自回归(NAR)架构。与在复杂的两级(文本到语义到声学)管道中遇到性能瓶颈的传统离散 NAR 模型不同,OmniVoice 直接将文本映射到多码本声学标记。这种简化的方法得益于两项关键技术创新:(1) 用于高效训练的全码本随机掩码策略,以及 (2) 从预训练的 LLM 进行初始化,以确保卓越的清晰度。通过利用完全由开源数据整理的 581,000 小时多语言数据集,OmniVoice 实现了迄今为止最广泛的语言覆盖范围,并在中文、英语和多种多语言基准测试中提供了最先进的性能。我们的代码和预训练模型可在 https://github.com/k2-fsa/OmniVoice 上公开获取。