论文

MeanVoiceFlow2:平均流和内容编码器的联合优化,用于快速一步零样本语音转换

MeanVoiceFlow2: Joint Optimization of Mean Flow and Content Encoder for Fast One-Step Zero-Shot Voice Conversion

摘要

语音转换(VC)的流匹配方法因其高语音质量和强说话人相似性而受到关注。其中,像 MeanVoiceFlow 这样的一步模型特别有吸引力,因为它们能够实现高效的推理;然而,它们对计算密集型内容编码器的依赖仍然是一个瓶颈。因此,我们提出了 MeanVoiceFlow2,一个联合优化基于流的转换模块和计算高效的内容编码器的框架。该模型通过使用 MeanVoiceFlow 的转换蒸馏和真实数据的重建进行训练。我们进一步将扩散 GAN 训练与样本混合和教师指导的条件增强相结合,以增强真实感和解缠结。零样本 VC 实验表明,MeanVoiceFlow2 比 MeanVoiceFlow 实现了更高的感知质量和大约 9 倍的推理速度,同时保持了可比的说话人相似性。音频样本可在 https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/meanvoiceflow2/. 获取