论文
MindEdit-Bench:根据野外照片对 VLM 中的对象级反事实空间推理进行基准测试
MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
摘要
视觉语言模型(VLM)的基准主要测试观察空间推理:模型描述输入中已经可见的关系。现有的假设任务通常会改变观察者,同时保持场景固定。 VLM 能否预测假设移动或旋转物体的后果?我们介绍了 MindEdit-Bench,这是六个空间推理任务的基准,通过自动野外 3D 场景图提取管道,从新捕获的室内场景的三张智能手机三元组构建而成。四项任务探讨对观察结构的感知和视角转换;两个新任务,L4(空间编辑)和 L5(跨视图可见性编辑),探测对象级反事实推理,其中所有输入图像中都没有正确答案。每个问题提供 8-24 个结构化答案选择,从而能够对空间错误和后备错误进行答案字母级诊断。该基准测试涵盖了 120 个并非来自公共数据集的私人室内场景,从而降低了公共数据预训练重叠风险。在针对 1,003 个人工验证问题的 15 个 VLM 中,任务方面的平均 VLM 准确度仅为 8%-31%,而人类多数投票的准确度为 81%-97%。人类与最佳 VLM 的汇总差距为 53 个百分点,其中每项任务至少有 39 个百分点。结构化答案空间进一步揭示了非均匀故障,包括较弱的相机深度轴推理和困难的可见性编辑案例的后备行为。