论文

StemBind:当 MLLM 在抽象视觉推理中的规则和实例之间迷失时

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 通常知道规则,但会选择错误的答案:在抽象视觉推理 (AVR) 任务中,模型可以描述它所看到的内容并命名底层模式,但仍然无法选择匹配的候选者。现有的 AVR 基准无法检测到这一点,因为它们将感知、规则归纳和答案选择分解为单个正确或错误的信号。我们引入了 StemBind,一个共享词干诊断基准,它通过三个对齐的问题来探测相同的视觉词干:感知(图像中是什么)、规则(什么模式控制它)和完整(哪个选项完成它),因此最终答案错误可以归因于同一证据上的特定子步骤。 StemBind 包含 2,298 个精选的知识光干,涉及 9 个可审核的视觉操作,总计 19,533 个 P/R/F 任务,每个完整项目都由 Sternberg 的四个推理阶段(S1 编码、S2 推断、S3 映射、S4 应用)进行注释。评估 24 个前沿 MLLM 配置得出四个结果。 (i) R-F 鸿沟:在 24 个模型中,有 22 个模型的规则准确度超过了全项目准确度,因此大多数故障发生在规则确定之后。 (ii) 持久的结合间隙:即使 P 和 R 在同一词干上都是正确的,模型仍然有 51.2% 的时间错误地回答 F。 (iii) 瓶颈是 S3:过程诊断和阶段式刺激增强定位了规则到实例映射的主要故障。 (iv) 规模化和思考无济于事:更大的模型和明确的思维模式都无法可靠地缩小差距,而且思维甚至会降低规则和全项准确性。 StemBind 将 AVR 评估从最终答案排名重新构建为定位抽象视觉推理失败的位置,将规则到实例绑定识别为基于视觉的推理的具体下一个目标。