论文

面向口音鲁棒跨语 TTS 的区域感知遮罩

Region-Aware Masking for Accent-Robust Cross-Lingual Text-to-Speech

模型训练监督微调与指令调优

摘要

口音泄漏仍然是跨语言零样本文本转语音 (TTS) 中的一个关键挑战,其中模型会无意中将说话者的音色和源语言口音转移到目标语言输出中。在掩码重建 TTS 中,这种情况会被训练推理不匹配放大:训练从相同语言上下文中重建,而推理条件则基于跨语言上下文。我们通过连接两种语言的话语并将重构掩模相对于语言边界放置来缩小这一差距,因此训练呈现了模型在推理时遇到的跨语言提示模式。这不需要语言 ID、重音标签、并行的同说话者录音或架构更改——只有掩码几何形状不同。在针对母语人士的听力研究中,与未适应的基线相比,区域感知掩蔽在 0-5 级上将感知口音从 4.3 降低到 0.5,并且与单独的双语适应相比,在已见的方案中降低了 18-51%,在未见的源语言中降低了 35-55%,而可懂度或自然度没有明显损失。比较掩模的几何形状表明,决定重音抑制和说话人保留之间平衡的是位置,而不是掩模的数量:仅限于重建区域的掩模最能抑制重音,但最不可靠地保留参考说话人,而双区域掩模则实现了两者。因此,掩模几何形状是实现重音鲁棒性的简单、有效的杠杆。

面向口音鲁棒跨语 TTS 的区域感知遮罩:论文原图
图 1:伪双语示例构造和区域感知屏蔽。 (a) 两个话语被连接成持续时间 $T_{0}$ 和 $T_{1}$ 的区域。 (b) 灰色表示可见的声学背景,红色表示流匹配损失中使用的屏蔽区域。