论文

从幻觉到视觉证据依赖:通过 CRISP 诊断视觉空间智能

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

模型评测评测方法与指标

摘要

目前的 VLM 评估经常将语言先验与真正的空间推理混为一谈。为了解决这个问题,我们引入了 CRISP,一种新颖的结构诊断评估范式,它通过一致性、内隐感知和外显推理之间的一致性来评估视觉空间智能。与传统的黑盒 QA 不同,CRISP 利用度量 3D 场景图和预言机干预协议将潜在推理能力与感知瓶颈解耦。这种精细的诊断揭示了系统性的感知推理脱节。至关重要的是,我们揭示了虽然专有模型拥有强大的潜在推理引擎,但它们存在度量估计不准确以及利用其隐式结构表示的严重失败。相反,开源模型仍然因缺乏多跳组合推理而从根本上受到瓶颈。通过将重点从仅仅通过语言先验“正确猜测”转移到真正的“感知、验证和推理”,CRISP 为超越端到端 后训练 的多模态对齐提供了严格的路线图。代码和数据集可在 https://github.com/iiyamayuki/CRISP-Bench 获取。