LLM 解码器听得好吗?对语言模型先验如何影响语音识别中的偏差进行基准测试
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
摘要
随着预训练的 大语言模型 取代语音识别中特定于任务的解码器,出现了一个关键问题:它们的文本派生先验是否使识别在人口群体中更公平或更有偏见?我们使用 Common Voice 24 和 Meta 的 Fair-Speech(一个消除词汇混淆的受控提示数据集)对跨三个人口统计轴(种族、口音、性别、年龄、第一语言)的约 43,000 个话语评估跨越三个架构代的 9 个模型(没有语言模型的 CTC、具有隐式 LM 的编码器-解码器和基于 LLM 的显式预训练解码器)。在干净的音频上,三个发现挑战了假设: LLM 解码器不会放大种族偏见(Granite-8B 具有最好的种族公平性,最大/最小 WER = 2.28); Whisper 对印度口音语音表现出病态幻觉,在大型 v3 中非单调插入率峰值达到 9.62%;音频压缩比 LLM 量表更能预测口音公平性。然后,我们在两个数据集的 12 种声学退化条件(噪声、混响、静音注入、块掩蔽)下对这些发现进行压力测试,总共 216 次推理运行。矛盾的是,随着所有群体都趋向于高 WER,严重退化会压缩公平差距,但沉默注入会通过触发人口选择性幻觉,将 Whisper 的口音偏差放大至 4.64 倍。在掩码下,Whisper 进入灾难性的重复循环(51,797 次插入中的 86%),而显式 LLM 解码器产生的插入次数减少了 38 倍,且重复次数接近于零;即使在 LLM 解码器中,高压缩音频编码(Q-former)也会重新引入重复病理学。这些结果表明,音频编码器设计(而不是 LLM 缩放)是公平且稳健的语音识别的主要杠杆。