论文

去哪里看? :VLM 中视觉编码器的因果追踪

Where To Look? : Causal Tracing of Vision Encoders in VLM

模型评测模型行为与机制分析

摘要

视觉语言模型可以非常准确地描述图像,但一个更基本的问题仍未得到解答:什么视觉信息实际上驱动了他们的答案?在这项工作中,我们通过因果追踪来研究这个问题,我们观察到高度因果视觉标记通常位于目标区域之外。将分析扩展到更大的视觉语言模型,揭示了模型和腐败设置之间的类似模式,这表明强大的多模态性能并不一定意味着空间局部的因果表示。我们进一步研究:当外观线索被移除时,这些模型能否保留视觉结构?并发现视觉线索被用来理解视觉结构。总之,我们的实验揭示了视觉结构的观看、使用和推理之间的差距,并为研究视觉信息如何被现代视觉语言模型转换、保存和最终使用提供了一个因果框架。