论文

视觉默认,先验覆盖:视觉语言模型中感知知识冲突的因果机制

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

模型评测模型行为与机制分析

摘要

当视觉证据与记忆的世界知识发生冲突时,视觉语言模型必须协调两者。他们如何解决这种冲突决定了多模式系统的可靠性,但之前的工作在没有组件级因果解释的情况下从行为上描述了它。我们将跨三个粒度(残差流、注意力头和 MLP 子层)的激活修补与模型组件消融研究和机制分析相结合。在三个 VLM 系列中,我们发现视觉证据依赖是默认出现的,而先验知识依赖取决于集中在网络后半部分的一小组因果必要的注意力头 (2.5-4.8%)。尽管视觉输入存在冲突,但这些头部可以从存储的世界知识中获得答案(例如,草莓的“红色”)。在先验知识提示下,消除它们会在 68-96% 的情况下将基于知识的预测翻转为基于视觉的答案,但仅改变 0.8-7.5% 的基于视觉的预测,建立不对称的因果结构。识别出的头分解为路由头(调制信息流)和写入头(直接将答案标记投射到剩余流中)。这种结构在模型系列和尺度上是一致的,揭示了 VLM 中感知知识冲突背后的稀疏因果回路。