论文
语音增强何时损害识别?推理时的极坐标投影诊断
Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis
摘要
语音增强 (SE) 可以显着提高感知质量,但增强语音不一定能改善自动语音识别 (ASR)。诸如增强伪影和过度抑制之类的常见解释仍然是定性的,并且没有定位哪个增强组件影响识别。我们研究推理时间极坐标投影,它将 STFT 掩模 $M=Ae^{jφ}$ 转换为 $M_{α,γ}=A^αe^{jγφ}$,并使用冻结的 SE 和 ASR 模型独立地改变幅度强度和估计相位校正。由此产生的响应曲线将普通增强与噪声比较中耦合的效果分开。在使用 FRCRN 的 VoiceBank+DEMAND 上,wav2vec2.0 在接近全幅值修正($α=.85$)时WER从17.13降至10.20,而 Whisper 在更弱的修正下达到最佳 WER,在 $α=.25$ 时WER从6.44降至5.57,并在全幅值时返回到 6.46。第二个增强器、面向鲁棒性的 ASR 模型和混响 WSJ0 混合集概括了该模式,并表明首选幅度区域取决于识别器和声学条件。在这些评估中,估计相位校正不是稳定的 ASR 杠杆:其效果较小,依赖于设置,并且一旦幅度强度固定,就无法提供一致的增益。