论文

LatentFlowSR:通过抗噪声潜在流匹配实现高保真音频超分辨率

LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching

应用与实践内容创作

摘要

音频超分辨率旨在从带宽有限的低分辨率音频中恢复丢失的高频细节,从而提高重建信号的自然度和感知质量。然而,大多数现有方法直接在波形或时频域中操作,这不仅涉及高维生成空间,而且很大程度上仅限于语音任务,对于音效和音乐等更复杂的音频类型留下了很大的改进空间。为了缓解这些限制,我们引入了 LatentFlowSR,这是一种新的音频超分辨率方法,它在潜在表示空间内利用条件流匹配 (CFM)。具体来说,我们首先训练一个抗噪声自动编码器,它将低分辨率音频编码到连续的潜在空间中。以低分辨率潜在表示为条件,CFM 机制使用一步常微分方程 (ODE) 求解器从高斯先验逐步生成相应的高分辨率潜在表示。然后,预训练的自动编码器对所得的高分辨率潜在表示进行解码,以重建高分辨率音频。实验结果表明,与各种音频类型和超分辨率设置的基准方法相比,LatentFlowSR 实现了具有竞争力或优越的性能。这些结果表明,该方法具有强大的高频重建能力和鲁棒的泛化性能,为音频超分辨率中潜在空间建模的有效性提供了令人信服的证据。所有相关代码将在论文评审过程完成后公开。