论文
UR-BERT:通过通用罗马化和语音标记预测扩展文本编码器以实现大规模多语言 TTS
UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction
摘要
我们提出了 UR-BERT,一种用于大规模多语言 TTS 系统的基于罗马化转录的文本到语音 (TTS) 编码器。由于可靠的 G2P 资源的可用性,传统的基于字素到音素 (G2P) 的方法仅限于大约 100 种语言。相比之下,UR-BERT 通过将不同的书写系统统一为共享的罗马化表示形式,扩展到 495 种语言。为了进一步增强语音保真度和文本语音对齐,我们在训练期间引入了语音标记预测目标,这鼓励编码器以数据高效的方式学习语音感知语音表示。实验表明,基于 UR-BERT 构建的 TTS 系统在多种语言和资源条件下始终优于最新的文本编码器基线,并对未见过的语言表现出强大的泛化能力。