论文
GaugeVLM:通过测量的几何干预构建空间监督
GaugeVLM: Structuring Spatial Supervision with Measured Geometric Interventions
摘要
视觉语言模型 (VLM) 可能会在同一空间关系的视图中相互矛盾,并且当该关系发生变化时无法做出响应。解决这些失败需要监督来捕获观察结果之间的误差幅度和几何依赖性,这两者都隐含在对个人答案或序数偏好的训练中。因此,我们引入了 GaugeVLM,它通过显式 3D 场景中的受控对象和摄像机干预使这种结构变得显式,从而产生具有测量的空间关系之间的差异和跨视图的共享事实的关联观察结果。为了将这种结构转化为学习信号,其核心目标 GaugeDPO 将测量的误差转换为偏好裕度,直接监督跨视图的正确规范排名,并将干预引起的答案几率对比与测量的关系变化与特定视图的尺度联系起来。我们的分析限制了典型的预测误差,并确定可以共同满足交叉视图和干预约束。根据经验,GaugeVLM 比三个 VLM 主干的监督微调改进了所有 10 个已建立的空间指标,主要 7B 模型在 MSMU 距离和 QSpatial+ 上分别提高了 15.0 和 18.9 个百分点。这些成果还扩展到自动驾驶和具身推理,展示了跨领域的强大泛化能力。