论文
Occ-VLM:用于室内场景理解的基于占用的视觉语言模型
Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding
摘要
最近,视觉语言模型 (VLM) 在 3D 场景理解方面取得了重大进展,推动了实体智能和机器人视觉等应用的进步。然而,现有方法通常要么直接依赖于显式 3D 输入(例如,点云或 RGB-D 序列),要么引入额外的 3D 几何编码器以从 2D 图像导出 3D 感知视觉标记。这种设计在结构上将 3D 几何感知与通过视觉语言 预训练 学习的丰富 2D 语义解耦,阻碍了统一 3D 视觉语言表示的开发。在这项工作中,我们提出了 Occ-VLM,这是一种用于 3D 场景理解的新颖框架,它纯粹对摆好的 RGB 图像进行操作并采用单个 2D 视觉编码器。具体来说,Occ-VLM 将 3D 场景占用率重建为辅助几何先验,用于将前景 2D 标记与 3D 空间在空间上关联起来。然后,这些标记由 大语言模型 (LLM) 进行解码,以实现统一的场景理解。大量实验表明,Occ-VLM 实现了准确的几何感知和强大的视觉语言推理:它在多视图占用预测方面获得了最先进的性能,同时在 3D 视觉问答 (VQA) 和 3D 密集字幕基准上的性能与 3D 输入 VLM 相当。