论文
多模态空间推理的视觉信用审核
Visual Credit Audit for Multimodal Spatial Reasoning
摘要
即使图像除了无图像上下文之外几乎没有提供支持,封闭的是/否空间基准也可以奖励正确的答案。在固定的强制选择界面下,视觉信用审核 (VCA) 分离两个估计值:基准图像是否比纯文本和空白对照为模型声明的决策提供更多支持,以及模型是否对特定于关系的视觉证据做出响应。第一次审核无需训练和标签,也不需要翻转答案。应用标签产生依赖信用正确性(D-CC);在正确的项目上,它等于相同控制标准答案对齐的正收益,而预测对齐则将审计扩展到错误。在四个开放的 MLLM 和两个空间基准中,12.73-26.25% 的决策是正确的但未经认可。匹配的同分割图像排列将 D-CC 减少了 21.25-47.80 个点,每个配对的 95% 间隔都高于零。固定像素关系对比和 3x3 证据源阶乘显示了为什么空控件无法识别关系响应。在受控的正确但未认可的协议决策中,对关系逆转的反应涵盖 81.57-100.00%,而 32.11% 汇总了更改答案。对 108 个几何兼容编辑的独立审核结果提供了有限的自然图像对应检查。因此,VCA 将基准测试的成功分解为正确性、附加图像支持和关系一致的响应。