论文
匹配对象还是关系:追踪 VLM 内部抽象推理
Matching Object or Relation? Tracing Abstract Reasoning Inside VLMs
摘要
视觉语言模型 (VLM) 在视觉基准方面表现出色,但在需要抽象推理的任务上却系统性地失败。现有的基准测试记录了这种失败,但无法说明为什么会发生这种情况或缺少哪种认知能力。我们通过采用比较和发展心理学中的关系匹配样本(RMTS)范式并将其与模型内部的机械分析相结合来缩小这一差距。在跨前沿 API 模型(GPT、Claude、Gemini)和三个开源系列(Qwen3.5、Gemma-4、InternVL3)评估的参数控制刺激集上,我们确定了将 VLM 转向关系匹配的四个杠杆——能力层、模型规模、每个场景的对象数量以及每个对象刺激噪声的缺失——共同产生了一条类似发展的轨迹,反映了人类关系转变。打开模型,每层表征相似性分析和因果中介分析表明,VLM 抽象推理是由两个相互竞争的电路实现的:早期电路根据图像的表面对象特征来组织图像,晚期电路根据图像的抽象关系来组织图像。将分析扩展到 ARC-AGI-1,我们发现消融 RMTS 上识别的关系头比消融随机头更会降低性能,这表明关系电路的招募超出了我们控制的刺激。我们希望这种机制级视图能够成为理解 VLM 中如何实现抽象推理的一步。
