论文
可解码不等于依赖视觉证据:用于VLM空间推理的图像消融检验
Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
摘要
通常通过线性探针读取模型潜在知识,再用激活干预后的恢复效果加以确认,但这可能系统性夸大VLM真正依赖图像的程度。本文研究空间推理,发现探针和干预都可能漏掉这种错误,而将图像替换为灰色空白即可揭示。探针对不同轴方向的答案解码准确率为73%—97%;无需训练的投影将一个接近随机水平的方向从59%提高到79%,看似解锁了潜在知识。然而空白图像检验揭示了三种被这些方法混淆的情况:依赖视觉且回答正确;不依赖视觉,其解码和表面恢复来自方向先验;以及信息可解码、可因果控制,却以错误符号使用的反向感知,此时表现低于随机水平,识别错误仍需要查看图像。在覆盖6个语言模型系列、2B—27B参数的14个模型中,水平方向依赖视觉、垂直方向主要依赖先验、深度方向出现反向使用,且反向使用随同系列模型规模扩大而出现。解码与实际使用方向相反的现象在5个系列的8个模型中有7个复现,修复所需的最小干预依具体几何而异:在最清晰的模型上,无需训练的旋转可匹配经过训练的编辑;分布更广的反转则需要学习低秩编辑,显示出不同模型的修复复杂度。低成本、自校准的空白图像检验可以区分视觉感知、反向感知和先验替代。作者建议将其作为VLM潜在知识和激活干预研究的常规对照。