论文

使用 2D VLM 的任务自适应grounding 3D 编程器

Task-Adaptive Grounded 3D-Programmers Using 2D VLMs

应用与实践视觉感知与空间理解

摘要

最近的视觉语言模型 (VLM) 表现出卓越的泛化和推理能力,但这些模型的 3D 理解受到数据规模、训练多样性和推理能力的限制。我们没有天真地将这些模型扩展到 3D,而是采取了不同的方法:通过引入 3D 基础和迭代反馈循环以及两个新颖的概念:规范坐标框架 (CCF) 和任务自适应反馈 (TAF),使强大的 2D VLM 在 3D 中可靠运行。 CCF 作为统一的视觉表示,将输入和输出锚定到共享的欧几里德坐标系,解决了 3D 基础中的常见挑战,例如轴模糊、公制比例不一致和浮动参考。作为对 3D 输入的结构化框架的补充,TAF 通过任务自适应动态反馈闭合推理循环,使 2D VLM 能够在其本地视觉上下文中执行各种开放词汇任务。在此基础上,我们引入了 3D-Prog,这是一种 3D 理解、推理和生成框架,它联合利用了 CCF 和 TAF 的功能以及强大的 VLM。无需任何重新训练,3D-Prog 即可跨对象级和场景级任务执行开放词汇 3D 理解、操作和生成。我们的实验表明,CCF 和 TAF 的联合使用可将 2D VLM 转变为几何感知的 3D 程序员,从而在不同的 3D 任务中实现一致、可解释和高质量的结果。