论文

Poly-SVC:具有谐波建模的复调感知歌声转换

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

应用与实践内容创作

摘要

歌声转换(SVC)旨在将源歌声转换为目标歌手,同时保留歌词和旋律。大多数现有的 SVC 方法依赖于 F0 提取器来从干净的人声中捕获主旋律。然而,现有的方法还没有能够可靠地从伴奏录音中提取干净的人声而不留下残留的和声。在本文中,我们创新性地提出了 Poly-SVC,这是一种零样本、跨语言歌声转换系统,旨在处理残余和声。 Poly-SVC 由三个关键组件组成:基于恒定 Q 变换 (CQT) 的音调提取器,用于保留主旋律和残余和声;随机采样器,用于减少来自 CQT 的干扰信息;以及基于条件流匹配 (CFM) 的扩散解码器,用于将音调、内容和音色特征融合为自然的复调输出。实验表明,Poly-SVC 在丰富和声录音和单旋律录音中的自然度、音色相似性和和声重建方面均超越了基线模型。