论文

多个一致的 2D-3D 映射,实现稳健的零样本 3D 视觉基础

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

应用与实践视觉感知与空间理解

摘要

零样本 3D 视觉基础 (3DVG) 是开放世界嵌入式 AI 的一项关键功能。然而,现有方法从根本上受到开放词汇 3D 提案质量差、类别不准确和几何不精确以及详尽的多视图推理的空间冗余的影响。为了应对这些挑战,我们提出了 MCM-VG,这是一种新颖的框架,通过显式建立多个一致的 2D-3D 映射来实现鲁棒的零样本 3DVG。 MCM-VG 不是被动地依赖嘈杂的 3D 片段,而是在三个基本维度上强制执行 2D-3D 一致性,以实现精确的目标定位和可靠的推理。首先,语义对齐模块通过 LLM 驱动的查询解析和从粗到细的 2D-3D 匹配来纠正类别不匹配。其次,实例校正模块利用 VLM 引导的 2D 分割来重建丢失的目标,反向投影这些可靠的视觉先验以建立准确的 3D 几何形状。最后,为了消除空间冗余,Viewpoint 蒸馏 模块对 3D 相机方向进行聚类以提取最佳帧。通过将这些最佳 RGB 帧与鸟瞰图配对成简洁的视觉提示集,我们将最终的目标消歧制定为视觉语言模型的多项选择推理任务。对 ScanRefer 和 Nr3D 基准的广泛评估表明,MCM-VG 为零镜头 3D 视觉基础设定了新的最先进技术。值得注意的是,它在 ScanRefer 上的 Acc@0.25 和 Acc@0.5 中达到了 62.0\% 和 53.6\%,大大优于之前的基线 6.4\% 和 4.0\%。