论文

匹配对象还是关系:追踪 VLM 内部抽象推理

Matching Object or Relation? Tracing Abstract Reasoning Inside VLMs

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 在视觉基准方面表现出色,但在需要抽象推理的任务上却系统性地失败。现有的基准测试记录了这种失败,但无法说明为什么会发生这种情况或缺少哪种认知能力。我们通过采用比较和发展心理学中的关系匹配样本(RMTS)范式并将其与模型内部的机械分析相结合来缩小这一差距。在跨前沿 API 模型(GPT、Claude、Gemini)和三个开源系列(Qwen3.5、Gemma-4、InternVL3)评估的参数控制刺激集上,我们确定了将 VLM 转向关系匹配的四个杠杆——能力层、模型规模、每个场景的对象数量以及每个对象刺激噪声的缺失——共同产生了一条类似发展的轨迹,反映了人类关系转变。打开模型,每层表征相似性分析和因果中介分析表明,VLM 抽象推理是由两个相互竞争的电路实现的:早期电路根据图像的表面对象特征来组织图像,晚期电路根据图像的抽象关系来组织图像。将分析扩展到 ARC-AGI-1,我们发现消融 RMTS 上识别的关系头比消融随机头更会降低性能,这表明关系电路的招募超出了我们控制的刺激。我们希望这种机制级视图能够成为理解 VLM 中如何实现抽象推理的一步。

匹配对象还是关系:追踪 VLM 内部抽象推理:论文原图
图 1:我们向 VLM 呈现的关系匹配样本 (RMTS) 任务。左:模型看到的提示。 VLM 从两个示例图像(样本 1 和样本 2)中学习到一个新颖的无意义标签 XXX,然后被询问两个测试候选图像(图像 A 或图像 B)中哪一个也是 XXX。右图:模型可以锁定的两个竞争解决方案。图像 A(上)保留了与全新对象(绿色方块)的小-大-小关系;因此,仅当模型将其绑定到样本之间共享的抽象关系(关系匹配)时,标签 XXX 才会推广到 A。图像 B(底部)重复使用了样本中出现的对象(蓝色圆圈和红色三角形),但打破了尺寸模式;仅当模型将其绑定到共享表面特征(对象匹配)时,标签才会推广到 B。这两个读数在构造上是互斥的:关系推理器选择 A,而基于表面对象相似性的系统选择 B。