论文
眼见为实:VLM 是否知道何时不回答空间问题(以及为什么)?
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
摘要
空间推理是现实环境中部署的视觉语言模型 (VLM) 的一项基本功能。然而,视觉观察本质上是 3D 世界的有限表示:遮挡会使对象不可见,而透视可能会使几何属性产生误导。尽管如此,现有的空间推理基准通常假设观察是充分且可靠的,重点关注模型是否产生正确的答案,而不是它们是否能够识别何时无法回答问题以及需要哪些额外的观察。在这项工作中,我们通过构建一个受控评估框架 SpatialUncertain 来挑战这一假设,并引入两种类型的观察挑战:(1)遮挡,隐藏目标信息;(2)透视模糊,产生误导性的视觉线索。对于每种配置,我们设计了在干净的观察下可以回答的空间问题,但在引入的挑战下需要弃权。我们进一步评估模型是否可以识别哪些额外的观点可以解决视角模糊性。我们在一系列不同的前沿开源和闭源 VLM 中的结果揭示了两种一致的故障模式。首先,模型很容易做出过于自信的回答,即使在视觉证据不完整或具有误导性的情况下也试图解决空间推理任务,在遮挡情况下平均准确率约为 30%,在透视模糊情况下低于 10%。其次,即使有其他视图可用,一些模型在识别哪些视图可以提供可靠证据时也几乎是随机的。总之,我们的研究结果呼吁超越答案的正确性,转向评估模型是否知道何时弃权以及如何寻求可靠的证据。