论文

SpatialQuery:视觉语言模型中基于几何的多实例空间推理基准测试

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

模型推理推理策略与问题分解

摘要

视觉语言模型 (VLM) 实现了强大的语义理解,但在度量空间推理中仍然不可靠,特别是当查询需要比较同一对象类别的多个实例时。我们通过最近实例距离查询(CIDQ)来研究这个问题,其中模型必须识别距唯一参考对象最近的可见候选对象,并估计它们的重力对齐地板平面距离。我们引入了 SPATIALQUERY(一种用于从单个 RGB 图像进行 CIDQ 推理的免训练框架)以及 SPATIALQUERY-1M(一个包含来自 200 个室内场景的超过 100 万个纯 RGB 问答对的基准)。 SPATIALQUERY 恢复实例级度量几何形状,并通过场景立方体将其转换为规范的鸟瞰图,它将对象表示为大小统一、类别编码的块,以强调它们的相对地板平面位置。我们进一步提出了不确定性感知思想链(UA-CoT)提示,它将几何导出的每个实例的不确定性纳入 VLM 推理过程。无需针对特定任务的 微调 或架构修改,使用 Qwen3-VL-8B 的 SPATIALQUERY 即可实现 0.259 m 的 Floor-MAE、90.5% 的 Unc-Acc@0.3 m 和 84.18% 的邻近决策精度,优于微调的空间专家、通用 VLM 和闭源前沿模型。代码、基准测试资源和交互式演示可在 https://namhai1810.github.io/SpatialQuery/ 上获取。