论文

SpatialSV:通过面向任务的视觉监督在 MLLM 中内化可解释的 3D 空间意识

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

应用与实践视觉感知与空间理解

摘要

解锁多模态 大语言模型 (MLLM) 的空间智能对于理解 3D 世界并与之交互至关重要。流行的方法通常通过外部工具注入空间先验,这会带来巨大的推理开销,或者依赖于潜在特征 蒸馏,该特征仍然无法解释并且缺乏细粒度的几何约束。为了解决这些问题,我们提出了 SpatialSV,这是一种框架,旨在将强大的 3D 空间意识内化到 MLLM 中,同时提供固有的可解释性。与被动特征模仿不同,SpatialSV 采用面向任务的视觉监督,迫使模型主动将其 2D 视觉特征提升为明确的 3D 表示,包括深度图、相机姿势和点云。至关重要的是,这种 2D 到 3D 提升过程为模型的表示提供了一个透明的窗口:生成的 3D 重建可作为直观的代理,用于可视化和诊断模型内在空间知识的质量。跨多个模型和基准的大量实验证明了 SpatialSV 在增强和解释 MLLM 空间智能方面的有效性。此外,该框架在半监督环境中表现出很强的泛化能力,验证了其利用未标记的视觉数据进行可扩展、可解释的空间表示学习的潜力。