论文

感知上更好,语义上更差:测量语音增强对基于 LLM 的语音系统的影响

Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems

模型评测评测方法与指标

摘要

语音增强 (SE) 通常用作语音 AI 管道中的预处理步骤,假设更好的音频质量可以提高下游任务性能。 SE 引起的扭曲是否会传播到下游 LLM 任务性能仍然是一个悬而未决的问题。我们引入了输出发散率 (ODR),它测量 SE 相对于干净语音更改 LLM 意图分类的频率,并使用 Whisper large-v3 和 wav2vec2-large 级联对 2,974 个 SLURP 剪辑的五个条件进行基准测试。每个条件都会产生显着高于零的 ODR($p < 0.001$,二项式检验)。尽管改进了 PESQ,但与未增强的噪声语音相比,MetricGAN{+} 的 ODR 增加了一倍以上(0.318 与 0.135),并且通过说话人替换,未缓解的回声达到了 0.836 的 ODR,这是 WER 无法捕获的故障。音频质量指标与 ODR 的相关性从接近零到中度不等(SQUIM-MOS $ρ=-0.068$,PESQ $ρ=-0.467$)。 MetricGAN{+} 和回声结果在 ASR 架构中复制,表明标准音频质量指标不足以满足 LLM 管道质量的要求。