论文

中心凹探针恢复视觉基础模型中的局部结合信息

Foveated Probes Recover Localized Binding Information in Vision Foundation Models

模型评测模型行为与机制分析

摘要

冻结视觉基础模型通常通过单个全局图像嵌入进行评估,但该接口可能会将丢失的信息与读出时丢失的信息混为一谈。我们通过保持预训练视觉编码器冻结并仅改变应用于其最终补丁标记的读数来研究这种区别。我们将标准全局读数与轻量级注视点读数进行比较,后者使用学习或问题条件查询来注意池补丁标记,并与可访问带注释的目标区域的预言机读数进行比较。我们在三个局部绑定问题上评估这些接口:杂乱条件下的受控合成颜色-形状绑定任务、无颜色拥挤形状检测变体以及 GQA 派生的自然图像任务,其中配对问题要求同一图像中不同同类别对象的颜色。当合成目标单独出现时,全局读数表现近乎完美,但在混乱和反事实目标编辑下崩溃,而中心凹读数则恢复了大部分预言机可访问的信号。在 GQA 派生任务中,与问题无关的全局图像向量仅比仅问题先验略有改善,而问题条件注视点则大大提高了配对局部颜色准确性。反事实的干扰信号比解释了合成失败:全局池化淡化了局部标签改变的证据,同时使探针暴露于来自不相关对象的干扰变化。这些结果表明,冻结视觉模型中明显的空间盲性可能是由全局嵌入接口引起的,而不是由于冻结补丁标记中空间信息的缺失而引起的。