论文
具有隐式和显式几何形状的 3D 感知 VLM
3D-Aware VLMs with Implicit and Explicit Geometries
摘要
尽管进展迅速,但大多数现有的基于 2D 视觉输入构建的视觉语言模型 (VLM) 在处理需要细粒度空间理解和推理的各种 3D 任务时常常遇到困难。为了弥补这一差距,我们提出了 VLM-IE3D,这是一个统一的框架,通过为 VLM 配备从 RGB 视频中学习的隐式和显式 3D 几何图形来增强 VLM 的 3D 空间感知。我们的 VLM-IE3D 引入了隐式几何标记 (IGT),可从输入视频中捕获高级几何先验,以及互补的显式几何标记 (EGT),可根据重建的 3D 属性对详细几何结构进行编码。最重要的是,VLM-IE3D 配备了 3D 感知适配器,可有效地将两种类型的几何表示与 2D 视觉提示融合在一起。这种纯 RGB 设计注入了强大的 3D 归纳偏差,可实现细粒度的空间理解和推理,而无需任何额外的 3D 输入。大量实验表明,VLM-IE3D 在各种 3D 任务中始终如一地实现了卓越的性能,包括 3D 视频检测、3D视觉定位、3D密集描述和空间推理。代码和模型可在 https://github.com/Vegetebird/VLM-IE3D 获取。