论文
语言上下文重新编码视觉语言模型的视觉表征
Linguistic Context Recodes Visual Representations in Vision-Language Models
摘要
目标导向的视觉处理是人类视觉智能的标志,支持下游任务如分类或搜索。尽管视觉语言模型(VLM)经常面临这些任务,但它们在呈现目标导向语言时重构视觉表示的能力仍不清楚。事实上,之前的大部分工作都假设视觉表示在VLM中是静态的,由语言表示操纵。在本工作中,我们提供了两个实例,证明语言诱导视觉表示的重构。首先,我们识别了一个抽象的参考表示,它表示在自然语言提示下哪些对象是目标相关的。我们提取与这个参考表示相对应的对比性引导向量,并展示了它们在模型预测中因果地涉及。这些参考表示是抽象的,因为它们可以泛化到不同的对象、不同的任务上下文甚至从合成图像到自然图像。其次,我们展示了语言诱导属性调制:后一层次层选择性地放大目标相关的属性,以视觉表示对象。我们展示了这一现象在不同类型的提示上。最后,我们提供了一个因果干预,表明属性调制在VLM的响应分布中起着中介作用。总的来说,我们的结果支持一种更动态的VLM跨模态处理的解释,而不是视觉标记作为静态信息存储器,它们被调节以支持语言提出的查询。
