论文

SpatialStack:用于 3D VLM 空间推理的分层几何语言融合

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

应用与实践视觉感知与空间理解

摘要

大型视觉语言模型 (VLM) 仍然难以实现可靠的 3D 空间推理,这是实体和物理 AI 系统的核心功能。这种限制源于它们无法捕获细粒度的 3D 几何和空间关系。虽然最近的努力已将多视图几何 Transformer 引入 VLM,但它们通常仅融合视觉和几何编码器的深层特征,丢弃丰富的分层信号并为空间理解造成基本瓶颈。为了克服这个问题,我们提出了 SpatialStack,这是一个通用的层次融合框架,可以在模型层次结构中逐步对齐视觉、几何和语言表示。 SpatialStack 超越了传统的后期视觉几何融合,将多级几何特征与主干语言进行堆叠和同步,使模型能够捕获局部几何精度和全局上下文语义。在此框架的基础上,我们开发了 VLM-SpatialStack,该模型在多个 3D 空间推理基准上实现了最先进的性能。大量的实验和消融表明,我们的多级融合策略持续增强 3D 理解,并在不同的空间推理任务中稳健地泛化,将 SpatialStack 建立为下一代多模态物理 AI 系统中视觉-语言-几何集成的有效且可扩展的设计范例。