论文

视觉语言模型中物体幻觉的双通路回路

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)在连接视觉感知和自然语言理解方面表现出了卓越的能力,能够实现广泛的多模态推理任务。然而,它们经常产生物体幻觉,描述输入图像中缺少的内容,这限制了它们的可靠性和可解释性。为了解决这一限制,我们提出了双通路电路分析,这是一种识别和表征 VLM 中与幻觉相关的电路的框架,用于机械理解和因果探测。我们首先在五个架构不同的 VLM 上应用激活补丁,以确定支持正确预测的视觉基础路径和驱动错误输出的幻觉路径。然后,我们引入条件通路分析(CPA)来表征通路级相互作用,揭示视觉依据关联成分在正确样本和幻觉样本中仍然具有很强的冗余性,但经历了一致的极性翻转,从支持正确样本上的 真值 转变为与错误样本上的幻觉答案保持一致。我们进一步对幻觉通路组件进行有针对性的抑制,结果表明,缩放这些组件可以以最小的准确度成本将物体幻觉减少高达 76%,并验证相同的电路选择性地转移到关系幻觉而不是属性幻觉。对 POPE-adversarial 和 AMBER 的评估表明,所识别的电路在不同架构中是一致的,支持因果干预,并且可以选择性地跨幻觉类型进行转移。