论文

从视觉语言模型中的单个对象进行上下文推理

Contextual inference from single objects in Vision-Language models

模型评测模型行为与机制分析

摘要

单个物体携带多少场景上下文是人类场景感知中一个经过充分研究的问题,但这种能力如何在视觉语言模型(VLM)中组织仍然知之甚少,这对这些模型的鲁棒性有直接影响。我们通过对单个对象的上下文推理进行系统的行为和机制分析来研究这个问题。在蒙版背景上呈现带有单个对象的 VLM,我们探讨了它们推断细粒度场景类别和粗略上级上下文(室内与室外)的能力。我们发现单个对象在两个级别上都支持高于机会的推理,其性能由预测人类场景分类的相同对象属性进行调节。对象身份、场景和上级预测是部分可分离的:一个级别的准确推理既不需要也不保证其他级别的准确推理,并且模型之间的耦合程度存在显着差异。从机制上讲,当背景上下文被移除时保持稳定的对象表示更能预测成功的上下文推理。场景和上位模式以根本不同的方式为基础:场景身份在整个网络的图像标记中编码,而上位信息只出现较晚或根本不出现。总之,这些结果表明,VLM 中上下文推理的组织比单独的准确性所暗示的更为复杂,具有行为和机械特征