论文
ArrayDPS-Refine:判别性多通道语音增强的生成细化
ArrayDPS-Refine: Generative Refinement of Discriminative Multi-Channel Speech Enhancement
摘要
多通道语音增强旨在从嘈杂的多通道录音中恢复干净的语音。大多数深度学习方法都采用判别性训练,这可能会导致基于回归的目标出现非线性失真,尤其是在具有挑战性的环境噪声条件下。受 ArrayDPS 用于无监督多通道源分离的启发,我们引入了 ArrayDPS-Refine,这是一种旨在使用干净的语音扩散先验来增强判别模型输出的方法。 ArrayDPS-Refine 是 无需训练、生成式且与数组无关。它首先根据判别模型生成的增强语音估计噪声空间协方差矩阵 (SCM),然后使用该估计的噪声 SCM 进行扩散后验采样。这种方法允许直接细化任何判别模型的输出,而无需重新训练。我们的结果表明,ArrayDPS-Refine 持续提高了各种判别模型的性能,包括最先进的波形和 STFT 域模型。 https://xzwy.github.io/ArrayDPSRefineDemo/ 提供了音频演示。