论文

MeanVC 2:稳健的低延迟流式零样本语音转换

MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

模型推理推理加速

摘要

流式零样本语音转换 (VC) 由于其实时应用的潜力而变得越来越流行。最近提出的MeanVC实现了轻量级流式零样本VC,但它有几个局限性:其分块自回归去噪使有效训练序列长度加倍,小块设置下转换质量下降,其音色编码器直接依赖于参考梅尔频谱图,使其对参考音频质量敏感。为了解决这些限制,我们提出了 MeanVC 2。我们引入了未来感受分块(FRC),它明确地调度跨扩散 Transformer 解码器层的过去和未来感受野,并消除干净块教师强迫。通过合并有界未来上下文,FRC 可以实现 40 ms 块大小的稳定转换。我们进一步引入了通用音色标记编码器,它从全局说话者嵌入构建音色表示,并通过交叉注意力检索细粒度的音色线索,提高对低质量参考的鲁棒性并增强零样本说话者相似性。实验结果表明,MeanVC 2 显着优于 MeanVC,同时将延迟从 211 ms 减少到 110 ms。音频样本是公开可用的。源代码将公开发布。