论文

OpenBibleTTS:适用于低资源语言的大规模语音资源和 TTS 模型

OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages

模型评测基准与评测资源

摘要

神经文本转语音 (TTS) 和多语言语音生成方面的最新进展极大地提高了合成语音质量,但这些成果在世界语言中的分布仍然不均匀。现有模型仍然以一小部分高资源语言为主,而许多低资源 TTS 研究是在人工下采样的高资源语料库上进行模拟的,这些语料库不能反映真正代表性不足的环境中遇到的拼写变化和有限的语音覆盖范围。因此,我们引入了 OpenBibleTTS,它是涵盖 37 种代表性不足的语言的低资源语音合成的大规模基准。此外,我们还对域内圣经文本和域外材料中的各种 TTS 架构和大规模语音生成模型进行了系统比较。结果表明,没有一个系统在跨语言和指标方面占据主导地位:Gemini-TTS 在大多数评估的语言上获得了最高的听众评分,但在 OpenBibleTTS 上训练的单语 EveryVoice 模型在可懂度方面仍然最强,并且在多种非洲语言中受到青睐,而开放式从头开始的系统在域外文本上的性能急剧下降,揭示了在服务不足的语言社区中广泛的多语言覆盖范围和可靠的合成质量之间持续存在的差距。我们用主观的人类判断来补充自动评估,并开源所有处理的数据集、比对和训练模型,以支持未来的低资源 TTS 研究。