论文

用于空间智能的双通道几何感知 MLLM

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

模型架构Transformer

摘要

通过 2D 视觉输入对物理世界的空间理解取决于几何知识的两种互补形式:整体 3D 结构感知和细粒度度量尺度估计。现有的多模态 大语言模型 (MLLM) 通常仅解决一个方面,将深度图或点云作为额外的模型输入,这会产生大量的计算开销,并继承了上游预测模型的泛化限制。我们提出了 GAMSI,一种用于空间智能的双路径几何感知 MLLM,它仅将 RGB 图像作为输入,同时在统一的自回归主干中内化两种形式的几何先验。具体来说,我们引入了度量结构解耦查询(MSDQ),它采用两组可学习查询分别从共享视觉上下文中提取密集的度量信号和稀疏的结构线索,并使用任务解耦的注意掩模进一步防止两条路径相互污染。在此基础上,专家引导的视觉基础(EVG)模块将聚合的线索投射回帧级视觉特征,并将它们与视觉基础模型对齐,该模型纯粹用作训练时监督,而不是作为模型输入。我们进一步构建了一个多任务空间指令调整数据集 (MTS),其中包含 152{,}776 个样本,涵盖 13 种任务类型和三种视觉模式,由六个公共数据集合并而成。经过两阶段课程的训练,GAMSI 在七个空间智能基准上实现了最先进的性能。