SpatialChain:VLM中空间推理可信度审核的基准
SpatialChain: A Benchmark for Auditing Spatial Reasoning Faithfulness in VLMs
摘要
支持思维的视觉语言模型(VLM)在空间基准上报告了更高的准确性,但最终答案分数无法揭示正确的预测是否反映了忠实的空间推理或语言捷径。我们引入了 SpatialChain,这是一个包含 28,350 个训练和 899 个测试示例的数据集,将面向空间的 GQA 问题与基于场景图的推理链配对,仅当生成的答案与符号地面事实匹配时才保留,以及将目标链重叠指标与场景图感知的LLM判断相结合的两轴评估,独立于最终答案对忠实性和完整性进行评分。应用于九个支持思考的VLM时,该协议揭示了标准精度不可见的三个发现:(i)九个模型中有四个达到了 $\geq$79% VQA 精度,同时表现出高于 39% 的快捷率,即正确答案的推理被法官标记为不忠实; (ii) 链质量显着预测九个模型中的七个模型的答案正确性,但两个例外(Claude Sonnet 4.6、InternVL3.5-8B)揭示了定性上不同的故障模式、简洁的输出与冗长的装饰推理,仅将基准准确性混为一谈; (iii) SpatialChain 上的 SFT 在域内将 Qwen3-VL-8B 提高了 +6.2 pp,并将其快捷率降低至 22%,而对外部基准的风格专业化效应则激励重放增强的训练作为缓解措施。忠实度法官针对 198 个人类注释的项目进行验证,其中法官与人类的一致性与人类与人类的一致性相匹配,并针对来自不同提供商的第二个法官进行验证,这保留了模型排名 ($ρ$ = 0.88)。数据、生成脚本和评估代码在https://github.com/spatialchain/SpatialChainBenchmark.发布
