论文

超越 3D VQA:将 3D 空间先验注入视觉语言模型以增强几何推理

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

模型训练监督微调与指令调优

摘要

视觉语言模型 (VLM) 常常难以应对强大的 3D 空间推理。依赖于 微调 和 3D 视觉问答 (VQA) 数据集的流行方法可能会过度拟合数据集特定的偏差,而集成专门的 3D 视觉编码器通常不灵活且繁琐。在本文中,我们认为真正的空间理解应该来自学习基本几何先验,而不仅仅是来自高级 VQA 监督。我们提出了 GASP(几何感知空间先验),这是一个将这些先验直接注入到 LLM 的 Transformer 层中的框架。 GASP 采用小型对应头,用作跨所有层的深度监督信号,并利用大型视频场景中的 真值 几何图形进行双重目标训练:真值 点对应上的对比损失强制执行 2D 视图不变性,而深度一致性监督则解决 3D 几何模糊性。我们的分析首先提供了一个诊断结果,显示标准 VLM 的内部对应匹配准确度非常低(通常低于 5%)。然后,我们证明我们的训练极大地改善了这种行为,将峰值逐层对应性提高到 70% 以上,并保持超过 85% 的时间鲁棒性,而基线仍低于 5%。这些内部改进转化为下游空间基准的显着提升,包括 All-Angles Bench 上的 +18.2% 和 VSI-Bench 上的 +29.0%,所有这些都无需对任何 3D VQA 数据进行训练。我们的研究结果表明,从基本几何先验中学习是实现具有更可靠 3D 空间推理的 VLM 的一条有前途且可推广的途径。