论文
SpatialForge:从开放世界 2D 图像引导 3D 感知空间推理
SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images
摘要
大型视觉语言模型 (VLM) 的最新进展展示了卓越的语义理解能力,但这些模型始终难以进行空间推理,常常无法完成深度排序和精确坐标定位等基本几何任务。最近的努力引入了以场景为中心的数据集(例如多视图扫描或室内视频)的空间监督,但受到底层场景数量有限的限制。因此,此类数据的规模和多样性仍然明显小于网络规模的二维图像集合。为了解决这一限制,我们提出了 SpatialForge,这是一种可扩展的数据合成管道,可将野外 2D 图像转换为空间推理监督。我们的方法将空间推理分解为感知和关系,并构建涵盖深度、布局和视点相关推理的结构化监督信号,并自动验证以确保数据质量。基于这个管道,我们构建了 SpatialForge-10M,一个包含 1000 万个空间 QA 对的大规模数据集。跨多个空间推理基准的大量实验表明,SpatialForge-10M 上的训练显着提高了标准 VLM 的空间推理能力,突出了缩放 2D 数据以进行 3D 感知空间推理的有效性。