论文
从 A 到 B 到 A:使用非并行数据的回文零样本语音转换
From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data
摘要
我们提出了一种语音转换 (VC) 框架,该框架利用 WavLM 表示上的 K 最近邻 (KNN) 检索来对齐非并行源语音和目标语音,构建用于监督学习的合成训练对。检索到的片段作为合成输入,而真实目标音频提供 真值 输出,形成合成到真实的训练范例,自然支持多语言数据,而不需要并行语料库或显式对齐。为了确保一致的目标说话人身份,我们结合了从预训练的说话人验证模型中得出的说话人损失。跨多种语言的实验表明,尽管仅在英语数据上进行训练,但所提出的方法仍实现了高度的自然度和很强的说话人相似性,优于竞争性的 VC 基线。示例可以访问:https://palindromic-vc.github.io。