论文
通过因果路线门控减轻大视觉语言模型中的幻觉
Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating
摘要
大型视觉语言模型(LVLM)通常会产生流畅但不受图像支持的内容,从而限制了它们在现实世界部署中的可靠性。我们表明,一个关键的失败模式源于路线竞争:即使视觉标记受到关注,最终的标记决策也可能由文本路径主导,导致解码器遵循语言先验而不是视觉证据。为了缓解这一问题,我们提出了一种 无需训练 决策对齐干预,将每个注意力头分解为视觉路径和文本路径,并使用有效的单前向/单梯度近似来估计它们的 词元级 效果。这些估计揭示了头部内部的路线冲突并识别了先前占主导地位的路线冲突,从而能够选择性地仅抑制文本路线,同时保持视觉路线完整。在跨越判别性和生成性设置的五个基准中,我们的方法持续减少了模型中与幻觉相关的错误,对整体多模态性能的影响有限,同时产生了适度的推理时间开销。