论文
通过学习 WavLM 空间中的 kNN 传输实现一步语音转换
One-Step Voice Conversion by Learning kNN Transport in WavLM Space
摘要
语音转换(VC)系统分为两个系列:非参数嵌入空间方法,不需要经过训练的模型,但会在短目标话语上降级;以及基于频谱图的神经架构,它通过具有数千万个参数的多模块管道实现强大的质量。我们提出了 kNN-FM-VC,这是一个单一的条件流匹配网络,它学习近似源和目标说话者的 WavLM 嵌入分布之间的 kNN-VC 映射,用在 kNN 生成的对上训练的神经回归器替换显式的逐点 kNN 匹配。该模型通过交叉注意力和 FiLM 以目标说话人为条件,并在三个高斯条件路径(薛定谔桥、直线和恒定方差高斯管)下进行训练,从而实现了少步采样。与 Phoneme Hallucinator 使用上采样阶段和 kNN 匹配不同,我们的 13M 参数模型使用单个学习网络执行转换并支持一步推理。在 LibriSpeech 上,一步高斯桥比 FreeVC 和 Phoneme Hallucinator 实现了更低的 WER 和更高的估计语音质量。相对于kNN和kDOT,它大大降低了WER。