论文

仲裁失败,而不是知觉失明:视觉语言模型如何解决视觉语言冲突

Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts

模型评测模型行为与机制分析

摘要

当视觉语言模型(VLM)看到蓝色香蕉并回答“黄色”时,是感知问题还是仲裁问题?我们在十个不同大小的 VLM 中探索了这个问题,并揭示了编码与视觉证据使用之间的分离:未能报告所看到内容(从而提供错误答案)的模型仍然对视觉证据进行编码,与提供正确答案的模型一样强烈。使用多模态仲裁交叉 (MAC) 分析和逐层 logits Lens 探测,我们跟踪每个模型每一层的视觉信号和先验信号之间的竞争。我们证明视觉属性可以从早期层线性解码(AUC > 0.86)。成功样本和失败样本的准确度几乎相同。然而,最后一层 logits 中的差距(而不是编码的强度)可以更好地预测视觉证据使用结果,相关性为 $ρ=$ 0.847。在研究了 VLM 何时根据图像线索而不是先验知识给出答案后,我们希望了解其中的因果关系。我们通过全序列激活修补来建立因果关系。 LLM 可解释性中的标准最后一个词元干预不会影响 VLM。相比之下,替换 MAC 识别的层上的完整词元序列会改变 60% 到 84% 的输出。部分标记分解表明,图像标记具有几乎所有的因果影响,而文本标记则没有。扩展解决了剩余的架构差异,以实现完美的保留。从诊断到干预,我们表明早期层中的 无需训练 激活控制(线性和稀疏自动编码器引导)可以将视觉证据使用能力提高高达 +3.8%,但在某些设置中会降低性能。总的来说,这些发现得出了一个明确的结论:VLM 已经看得很清楚,但挑战在于根据他们所看到的采取行动。有针对性的干预措施可以帮助缩小这一差距。