论文
用于多通道语音增强和分离的统一扩散细化
Unified Diffusion Refinement for Multi-Channel Speech Enhancement and Separation
摘要
我们提出了 Uni-ArrayDPS,这是一种新颖的基于扩散的细化框架,用于统一多通道语音增强和分离。现有的多通道语音增强/分离方法大多具有判别性,并且在产生高信噪比输出方面非常有效。然而,它们仍然可以生成不自然的语音,并具有由神经网络和基于回归的目标引起的非线性失真。为了解决这个问题,我们提出了 Uni-ArrayDPS,它使用语音扩散先验来细化任何强判别模型的输出。 Uni-ArrayDPS 是生成式的、与数组无关的、无需训练,并且支持增强和分离。给定判别模型的增强/分离语音,我们将其与噪声混合物一起使用来估计噪声空间协方差矩阵(SCM)。然后,我们使用该 SCM 来计算干净语音源的扩散后验采样所需的可能性。 Uni-ArrayDPS 仅需要预先训练的干净语音扩散模型作为先验,不需要额外的训练或 微调,使其能够直接跨任务(增强/分离)、麦克风阵列几何结构和判别模型主干进行泛化。大量实验表明,Uni-ArrayDPS 持续改进了增强和分离任务的各种判别模型。我们还报告了真实世界数据集的强劲结果。音频演示位于 \href{https://xzwy.github.io/Uni-ArrayDPS/}{https://xzwy.github.io/Uni-ArrayDPS/}。