论文
提取视觉语言模型中空间推理的路由 3D 特权
Distilling Routed 3D Privilege for Spatial Reasoning in Vision-Language Models
摘要
空间推理仍然是视觉语言模型 (VLM) 的一个长期弱点,因为 RGB 输入不直接提供几何证据。现有的补救措施要么在推理时将 3D 注入模型,支付架构和延迟成本,要么使用仅监督最终答案的结果奖励进行训练。空间错误源于感知:错误判断的深度或方向只能通过场景的真实几何形状来纠正,而空间训练语料库的 3D 扫描源已经提供了该几何形状。我们提出了GPD(Geometry-Privileged Distillation),它使几何证据成为on-policy self distillation(OPSD)中的特权。对于每个问题,深度、语义和鸟瞰 (BEV) 提示都会呈现为紧凑的文本,并与参考答案一起发送给教师;仅应用于不正确的轨迹的特权 KL 增强了 GRPO,并且部署的模型仍然仅是 RGB。在 4B 主干上,GPD 在 VSI-Bench 上达到 57.1,在 MindCube、SPARBench、MMSI-Bench 和 ViewSpatial 上达到 37.6 的平均值,优于 GRPO 和应答特权 OPSD 空间推理基准。消融证实了 3D 和答案特权的互补性、问题条件路由相对于全上下文注入的优势,以及将蒸馏限制到不正确的轨迹的好处。