论文

大视觉语言模型中的紧急目标导向注意力

Emergent Goal-Directed Attention in Large Vision-Language Models

模型评测模型行为与机制分析

摘要

人类观察者根据任务目标对视觉信息进行优先级排序。大多数自然观看的计算模型都是针对自由观看进行凝视训练的,因此在没有凝视监督的系统中是否可以出现目标导向的注意力仍是一个悬而未决的问题。我们在视觉搜索和自由观看指令下的 4,887 个自然场景中测试了两种现成的视觉语言模型 (VLM):Qwen3-VL-32B-Thinking 和 Gemma-4-26B-A4B-it。将模型预测与人类在相应任务下对相同图像的注视进行比较。与目标不匹配的情况相比,两种模型在匹配目标下都更符合人类的注视。这种交叉在目标缺失的场景中持续存在,其中对齐无法通过简单的视觉基础来解释,并且出现在解码器层读数中。此外,模型思维痕迹基于搜索期间的目标语义和自由观看期间的视觉突出性。这些发现表明,通用 VLM 可以生成与人类一致的、目标导向的空间优先级,而无需特定注视的训练,为目标导向注意力的理论提供信息,并提供可扩展的工具来预测人们在任务中注视的位置。