论文

扎根的 3D 感知空间视觉语言建模

Grounded 3D-Aware Spatial Vision-Language Modeling

应用与实践视觉感知与空间理解

摘要

我们提出了 GR3D,一种空间视觉语言模型,在单一框架内配备了三种互补的基础功能——显式 2D 基础、隐式 2D 基础和单目 3D 基础。 GR3D 引入了一种隐式基础机制,可在生成过程中识别实体提及并将相应的区域标记插入到文本流中,从而允许模型在生成空间思维链响应时动态引用视觉证据。同时,区域提示的单目 3D 定位设计通过定位区域查询预测摄像机视图中的 3D 边界框,并得到内在感知归一化和密集几何监督的支持。这些基础功能共同使 GR3D 能够将复杂的空间理解问题分解为基础的 2D 感知,然后进行 3D 推理。 GR3D 在定位和非定位空间基准上实现了一致的改进,证明定位是加强 VLM 空间理解的有效归纳偏差。这些定位能力共同增强了定位任务本身之外的一般空间理解。