论文
眼见并非测量:视觉语言模型的工具增强度量空间推理
Seeing Is Not Measuring: Tool-Augmented Metric Spatial Reasoning for Vision-Language Models
摘要
视觉语言模型 (VLM) 可以很好地描述场景,但对于度量 3D 结构(例如绝对距离、物理尺寸或自我中心方向)的推理能力较差。我们提出了一个模块化、与预测器无关的工具增强框架,为小型 VLM (Qwen3.5-4B) 配备了几何工具:3D 对象检测、度量深度估计以及距离、尺寸和方位的确定性求解器。每个对象都会在其自身最佳视图的相机框架中检测到,并且这些工具使用该框架的姿势将每个检测提升到一个共享的世界框架中。将度量计算从模型权重转移到显式求解器中,可以在四项 ReVSI-Bench 任务中的三项上获得巨大收益:使用强大的单目检测器 (WildDet3D),绝对距离平均相对精度 (MRA) 从 0.46 上升到 0.74,相对距离从 39.1% 上升到 67.4%,相对方向从低于概率的 25.9% 上升到 73.4%。由于任何检测器都可以在工具界面后面进行交换,因此将真实检测器与真实框进行比较可以将感知错误与推理错误分开:编排成本仅为 0.03 MRA。物体大小受到检测器的限制:工具在真实盒子上几乎是精确的(0.97),但最好的真实检测器几乎无法击败无工具基线(0.61 vs. 0.58),因为尺寸直接从盒子范围读取单目检测器会出错。在没有预定义配方的情况下,该模型已经自行正确地对工具进行排序,在四个任务中的三个上匹配脚本化管道。