论文
通过幻觉空间投影减少Whisper中的幻觉转录
Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection
摘要
Whisper是自动语音识别(ASR)领域广泛使用的基础模型,但其生成式解码器在输入中缺乏语音时会产生流畅的幻觉转录。我们提出一种无需训练、在推理阶段使用的低秩投影方法,通过解码器激活的低秩投影来减少此类幻觉。利用非语音校准数据估计一个紧凑的与幻觉相关的子空间,在推理时将解码器隐藏状态投影到该子空间之外。我们评估了两种变体:始终启用,对所有输入应用投影;以及门控,仅在Whisper预测输入可能无语音时应用投影。在非语音基准中,始终启用投影将平均幻觉率(HR)从31.31%降至2.44%,相对减少92.21%;门控投影将HR降至3.74%,相对减少88.05%,且在真实语音误拒率(FRR)上更低。在LibriSpeech上,门控投影使绝对词错误率(WER)增加0.33至4.39个百分点,不同模型和分割设置下的FRR为0.41至9.97%。结果表明,低秩激活投影可在不重新训练的情况下显著抑制Whisper的幻觉,同时提供在抑制幻觉与语音识别性能之间的可控权衡。