论文

DTT-BSR+:用于音乐源恢复的生成回归级联

DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration

应用与实践内容创作

摘要

音乐源恢复(MSR)需要共同解决源分解和非线性制作效果的反转。当前的方法很难在保持语义一致性的同时实现准确的目标信号重建。为了解决这一限制,我们提出了 DTT-BSR+,这是一种两级级联 MSR 系统,它将分布拟合从信号重建中解耦到单独的阶段。第一阶段中的生成式 DTT-BSR 分离器产生与干净源的先验匹配的词干,第二阶段中的修改后的 Demucs 网络使用时域和多分辨率光谱损失增强第一阶段的输出。与单级 DTT-BSR 相比,DTT-BSR+ 在所有茎上提高了多梅尔信噪比 (MMSNR),并在五个茎上超越了最先进的 X-LANCE MSR 系统。我们还通过 Fréchet 音频距离(FAD)分解揭示了信号重建精度和跨词干语义分布拟合之间的隐式权衡。