论文
一致但错误:空间视觉语言模型中的证据不敏感
Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models
摘要
空间推理是机器人技术、自主性和嵌入式人工智能的基础,但现代视觉语言模型 (VLM) 在公制距离查询上仍然不可靠。一个常见的假设是,跨观点的一致预测反映了几何基础。我们测试这个假设并发现相反的情况:领先的 VLM 通常会产生视图不变且一致的答案,即使这些答案不正确,这表明预测与特定视点的视觉证据之间的耦合较弱。我们引入了 \textbf{ViewDiag},这是一种由 Hypersim、ScanNet 和 KITTI360 构建的受控多视图评估协议,包含跨 80 个场景的 176 个对象对轨迹,每个轨迹有 2--10 个视图。该协议沿着三个轴评估模型:度量精度、分布浓度和内部崩溃,最后一个轴是使用潜在特征探针进行评估的。在不同的模型中,我们观察到高预测稳定性与显着误差相结合的一致模式,以强一致性但低准确性为特征的聚类。 \noindent 这些结果对跨视图一致性作为几何理解代理的普遍使用提出了挑战。相反,我们表明稳定的预测可能反映了先验驱动的崩溃,而不是证据敏感的推理。 ViewDiag 提供了一个受控基准和诊断框架,用于评估空间 VLM 是否不仅准确,而且与视觉证据有意义地耦合。