论文
VLM3:视觉语言模型是原生 3D 学习器
VLM3: Vision Language Models Are Native 3D Learners
摘要
视觉语言模型(VLM)使统一的模型能够通过提示来解决各种视觉任务。他们在语义理解方面表现出了有希望的表现。然而,3D 理解仍然在很大程度上依赖于具有复杂的特定任务设计的专家视觉模型。这项工作想要提出的关键论点是 VLM 是原生 3D 学习器。我们深入的大规模研究表明,1) 焦距统一、2) 基于文本的像素参考和 3) 数据混合和缩放,是有效 3D 学习所需的全部。模型架构的变化、大型模型、大量数据增强以及包括回归公式在内的复杂损失,其中许多构成了专家视觉模型的基础,但实际上并不是必要条件。因此,我们提出了 VLM3,这是一种具有最简单设计的可扩展方法,使标准 VLM 能够掌握各种 3D 任务。 VLM3 不仅大幅提高了 VLM 深度估计精度(0.84 -> 0.9),而且还支持多种 3D 任务,例如像素对应、相机姿态估计和对象级 3D 理解,在保持标准架构和基于文本的训练的同时,匹配专家视觉模型的精度。我们相信 VLM3 为简单且可扩展的 3D 学习开辟了新范例。