论文
检索头遇见视觉:揭示 VLM 如何定位和提取视觉信息
Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information
摘要
视觉语言模型(VLM)可以定位文本提示引用的图像区域,并将相应的视觉证据路由到输出,但这种行为背后的内部机制尚不清楚。受到 大语言模型 中检索头的启发,我们询问 VLM 是否包含类似的视觉检索机制。我们通过引入视觉检索头(VRH)来给出肯定的回答,它是注意力头的一小部分(约 1.7-2.6%),负责将文本描述目标定位到图像区域。为了找到它们,我们在查询标记、密钥聚合和跨样本聚合的统一设计空间下重新设计了现有的头部评分方法。然后,我们表明,通过 真值 所指区域的总和对输出预测标记的注意力进行评分最可靠地识别因果头。在 11 个 VLM 和 5 个引用表达基准中,仅屏蔽前 20 个 VRH 会使目标定位准确度降低高达 80 个百分点,而屏蔽相同数量的随机头几乎没有影响。除了复制为文本检索头建立的因果稀疏通用三元组之外,VRH 还表现出一些以前未报道过的属性:它们在视觉参考任务中进行泛化,尽管是通过边界框预测发现的,但在属性、空间、计数和视觉数学基准上仍然保持因果关系;它们在功能上是特定的,保留输出格式,同时破坏本地化;它们在架构上是共享的,在共享 LLM 主干的 VLM 之间进行因果传输,但在视觉编码器、投影仪和指令调整方面有所不同。