论文

通过噪声不变声学语义 蒸馏 减少基于 LM 的语音增强中的语言幻觉

Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation

应用与实践内容创作

摘要

基于语言模型 (LM) 的语音增强 (SE) 可以生成听起来自然的语音,但在严重的噪声下,它常常会受到不可靠的调节的影响,从而导致感知上合理但语言上不正确的输出。为了解决这个问题,我们提出了 L3-SE,一种噪声不变的声学语义 蒸馏 框架,用于减少基于 LM 的 SE 中的语言幻觉。该方法通过联合提取两个互补的干净语音目标,从噪声语音中学习噪声不变条件编码器:用于重建保真度的声学目标和用于语言一致性的语义目标。由此产生的噪声不变声学语义表示用于条件仅解码器的自回归语言模型,该模型预测解码为增强语音的干净声学标记。为了支持高质量生成,我们进一步采用基于可学习加权 WavLM 层表示的高保真编解码器作为离散声学接口。通过提高不利条件下调节的可靠性,所提出的框架大大减少了幻觉并改进了内容 忠实性。实验表明,所提出的方法在语言一致性指标上始终优于先前基于 LM 的语音增强基线,在低 SNR 和混响条件下具有特别明显的增益,同时保持有竞争力的感知质量。音频样本可在 https://max1wz.github.io/L3-SE-Demo-Page/ 获取。稿件被接受后,将发布完整的源代码。