论文
用于免训练语音转换的共享状态本地翻译
Shared-State Local Translations for Training-Free Voice Conversion
摘要
在一次性免训练语音转换(VC)中,源话语和参考话语可能包含不同的语言内容,因此无法假设它们之间存在可靠的帧级对应关系。我们提出了 StateVC,它从源和参考话语的池化帧级 WavLM 表示中联合定义了一组公共局部区域;我们将这些地区称为州。这些共享状态是通过将特定对的高斯混合模型拟合到池表示中获得的,无需显式的源参考帧匹配。在每个状态内,StateVC 估计原始 WavLM 空间中的源到参考均值偏移。然后,源帧后验概率结合特定于状态的偏移,以便不同的帧可以接收不同的局部更新。对于 LibriSpeech 一次性协议,StateVC 在评估的系统中实现了最低的字错误率 (WER) 和字符错误率 (CER),分别为 8.01% 和 3.22%,说话人相似度 (SIM) 为 0.9512。它还在评估的系统中实现了最高的平均感知说话者相似度,在评估的免训练系统中实现了最高的平均自然度。