论文
Joycent:通过解开的口音建模和特定于层的调节实现多口音 TTS
Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning
摘要
口音文本转语音 (TTS) 旨在合成具有目标口音的语音,同时保留说话者身份,但面临两个关键挑战:将口音与说话者特征分离,以及根据两个分离的因素有效调节语音生成。在本文中,我们提出了 Joycent,一个基于扩散的口音 TTS 框架,可以解决这两个挑战。我们的关键想法是在表征学习和 TTS 调节中分离口音和说话者信息。 Joycent 使用 WhisAID(一种基于 Whisper 的带有梯度反转的口音编码器)来学习说话人解开的口音表示,并引入特定于层的条件层归一化,以在文本编码器的不同阶段注入口音和说话人信息。我们在普通话地区口音语料库 (MRAC) 上对 Joycent 进行了评估,其中包括见过和没见过的说话者,包括具有挑战性的跨口音设置,其中说话者和口音提示来自不同的口音。实验结果表明,Joycent 比现有方法提高了口音相似度,同时保持了较强的说话者相似度,在具有挑战性的交叉口音设置下具有一致的增益。主观评估进一步证实了自然度、口音相似性和说话者保留的改善。音频样本可在 https://oshindow.github.io/joycent/ 获取。