论文

视觉语言模型中的对象定位机制

Mechanisms of Object Localization in Vision-Language Models

模型评测模型行为与机制分析

摘要

基于视觉的语言模型 (VLM) 在链接视觉和文本信息方面非常有效,但它们常常难以完成基本的分类和本地化任务。虽然分类机制已经得到了更广泛的研究,但支持对象定位的过程仍然知之甚少。在这项工作中,我们使用一套机械解释工具(包括标记消融、注意力剔除和因果中介分析)研究了两个代表性家族 LLaVA-1.5 和 InternVL-3.5。我们发现定位是由容器化机制驱动的,其中对象对齐的标记定义了对象的空间范围,而这些边界内标记的语义排列在很大程度上与预测的框无关。只有一小部分注意力头介导分类和定位的因果效应,集中在 LLaVA 的早中层和 InternVL 的中晚层。这两项任务共享一些早期处理,但最终取决于很大程度上不同的专门负责人。总的来说,我们提供了 VLM 本地化的第一层和头层说明,揭示了可以指导未来模型设计和基础目标的狭窄计算路径。