论文
LIFT-SE:先推断语言内容再连续修复的生成式语音增强
LIFT-SE: Linguistic Inference Followed by Flow Transformation for Generative Speech Enhancement
摘要
当语义约束在严重噪声和混响下不可靠时,生成语音增强(SE)很容易出现语言幻觉。此外,生成离散编解码器Token的方法受到编解码器解码器的量化误差的限制,无论Token预测精度如何。我们提出了 LIFT-SE,这是一个两阶段的生成框架,它将语言推理与 QRes-Codec 内的声学合成解耦,暴露了量化的潜在特征及其残差完成的连续形式。第一阶段以自回归方式预测干净的编解码器标记,以来自自监督前端的帧对齐特征为条件,提取干净的语音。第二阶段应用条件流匹配将高斯噪声传输到以预测标记为条件的连续潜在变量,并且冻结解码器重建增强的波形。离散生成提供自然度,而连续细化恢复信号保真度。 DNS1 和 URGENT 基准测试的实验表明,LIFT-SE 在混响下获得了良好的语言一致性 条件以及竞争性感知质量和系统消融验证了这两个阶段的必要性。代码将在未来发布。