论文
Proxy3D:通过语义聚类和对齐实现视觉语言模型的高效 3D 表示
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
摘要
视觉语言模型 (VLM) 中的空间智能吸引了人们对 3D 世界中推理的实际需求的研究兴趣。尽管结果很有希望,但大多数现有方法都遵循 VLM 中的传统 2D 流程,并使用像素对齐的视觉模态表示。然而,具有隐式 3D 场景理解的基于对应的模型通常无法实现空间一致性,而具有 3D 几何先验的基于表示的模型在视觉序列序列化方面缺乏效率。为了解决这个问题,我们提出了一种 Proxy3D 方法,为视觉模态提供紧凑而全面的 3D 代理表示。仅将视频帧作为输入,我们使用语义和几何编码器来提取场景特征,然后执行语义感知聚类以获得 3D 空间中的一组代理。对于表示对齐,我们进一步整理 SpaceSpan 数据集并应用多阶段训练以采用 VLM 提出的 3D 代理表示。当使用较短的视觉信息序列时,我们的方法在 3D 视觉问答、视觉基础和一般空间智能基准方面实现了有竞争力或最先进的性能。