论文
凝视头:VLM 如何看待他们所描述的内容
Gaze Heads: How VLMs Look at What They Describe
摘要
视觉语言模型如何在内部解决描述图像的任务还远非显而易见。我们发现该模型为此开发了一种特定的机制:其语言模型主干中的一小组注意力头,我们称之为凝视头,其注意力跟踪模型当前描述的图像区域。我们使用漫画作为受控测试平台,在空间上布置叙事顺序,通过几次前向传播找到了它们的简单相关分数。这些注视头不仅仅跟踪所描述的图像标记:将它们的注意力重新定向到选定的区域,迫使 VLM 来描述该区域。对前 100 个凝视头(占所有头的不到 9%)进行单一注意力掩模干预,可以以 83.1% 的准确率引导模型对任何选定的漫画面板的答案,而对随机头的相同干预无法重定向答案,并且对所有头进行干预会破坏生成。同样的杠杆还扩展到持续控制:在生成中期切换凝视目标使模型结束其当前的面板描述,并在几个标记内移动到新的面板描述。除了漫画之外,同样的干预措施将答案重定向到自然 COCO 图像中的选定区域。该机制在从 2B 到 32B 参数的模型大小以及其他 VLM 架构中进一步重复出现,尽管一些冻结编码器系列没有显示可比较的头戴装置。更广泛地说,这表明通过机械分析确定的有针对性的编辑可以作为指导多模态模型行为的实用推理时间杠杆,而无需任何重新训练。我们的代码、交互式演示和数据集可在 https://gaze.baulab.info/ 获取