论文
超越 U-Net:用于流匹配语音增强的潜在表示对齐无跳过骨干网
Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement
摘要
生成模型,特别是扩散和基于评分的方法,最近在语音增强方面取得了强大的性能,但其迭代采样过程限制了实时部署。流匹配提供了一种有效的替代方案,通过很少有函数评估的常微分方程将噪声语音传输到干净的语音。在这项工作中,我们提出了一种在潜在表示对齐(LRA)指导下用于流匹配语音增强的无跳过编码器-解码器主干。该模型不依赖于 U-Net 跳过连接(可能会将与噪声相关的底层特征传输到解码器),而是将其瓶颈和解码器表示与从冻结的 Descript Audio Codec 编码器-解码器中提取的干净潜在特征(无需量化)对齐。这种与编解码器一致的监督促进了紧凑的干净语音表示,同时保留了高效的少步推理。 WSJ0-CHiME3 和 VoiceBank-DEMAND 上的实验表明 PESQ 和感知质量有所改善,特别是在 VoiceBank-DEMAND 上,仅使用五个函数评估。