论文

UltraM2M:利用文本转录和混合约束进行弱监督语音增强

UltraM2M: Leveraging Text Transcripts and Mixture Constraints for Weakly-Supervised Speech Enhancement

应用与实践语音交互与综合语音服务

摘要

我们提出了 UltraM2M,这是一种基于最近的无监督混合到混合 (M2M) 算法的弱监督语音增强算法。 M2M通过训练深度神经网络对一组真实记录的噪声混响多通道混合信号实现无监督语音增强,以估计目标语音和非目标信号。这两个估计信号受到所谓的混合约束(MC)损失的惩罚,这限制了它们重建观察到的混合信号。尽管被证明是有效的,但混合约束可能太弱而无法实现充分的降噪。为了解决这个问题,UltraM2M 通过进一步利用真实记录混合物的文本转录来设计自动语音识别 (ASR) 损失来惩罚估计的语音信号,从而扩展了 M2M。 ASR 损失可以被视为弱监督的一种形式,有助于无监督增强。在CHiME-4数据集上的评估结果显示了UltraM2M的有效性。

UltraM2M:利用文本转录和混合约束进行弱监督语音增强的原论文方法或结果图
图 3:CHiME-$4$ 混合物示例的增强结果:(a) 未处理的混合物; (b) 超级M2M; (c) UltraM2M-Whis 和 (d) 监督。