论文

解锁 VLM 中的密集度量深度估计

Unlocking Dense Metric Depth Estimation in VLMs

模型训练监督微调与指令调优

摘要

视觉语言模型 (VLM) 擅长 2D 任务,例如基础和字幕,但在 3D 理解方面仍然有限。一个关键的限制是它们的纯文本监督范式,它限制了细粒度的视觉感知并阻止了密集几何的恢复。先前的方法要么从外部视觉模型中提取几何图形,引入误差累积,要么通过低效的每像素查询或粗略的 词元级 输出来实现直接预测。在本文中,我们提出了 DepthVLM,这是一个简单而有效的框架,可将单个 VLM 转换为原生密集几何预测器,同时保留其多模态功能。通过将轻量级深度头附加到 LLM 主干,并在统一的视觉文本监督范例下进行两阶段计划的训练,DepthVLM 在一次前向传递中生成全分辨率深度图以及语言输出。我们进一步引入了 VLM 兼容格式的统一室内外度量深度基准。实验表明,DepthVLM 显着优于现有 VLM,具有更高的推理效率,超越领先的纯视觉模型,并改进了复杂的 3D 空间推理,向真正统一的多模态基础模型迈进。项目页面位于 https://depthvlm.github.io/