论文

GRAFT:嫁接参考音频,用于零样本文本转语音中的细粒度发音

GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

应用与实践内容创作

摘要

我们提出了 Graft,一种用于文本到语音神经编解码器语言建模的每个单词的发音调节机制。现有系统达到了很高的清晰度和自然度,但继承了文本的歧义性,并且错误地发音了罕见的专有名词、借词和技术术语。即使音素调节模型也不提供每个单词发音的直接声学处理。 Graft 从简短的口语样本中控制所选单词的发音,使用模型自己的语音标记器进行编码,并绑定到提示中单词的位置。训练数据构建过程中的语音转换将提示说话者与目标说话者分开,因此提示可能来自任何语音,而输出仍保留在目标语音中。在一项盲英语听力研究中,人类评分者根据其对最难单词的翻译与该单词的参考录音最接近,将 Graft 以明显优势排名第一。在五种语言的客观基准上,Graft 比相同的纯文本骨干网将目标词音素错误率降低了 22-39%,并且在目标词发音方面优于竞争性开源零样本系统(音素和文本条件),同时保持说话者的相似性和自然度。