论文

思考、行动、构建:带有视觉语言模型的代理框架,用于零样本 3D 视觉基础

Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding

智能体系统Agent 架构与控制循环

摘要

3D 视觉基础 (3D-VG) 旨在通过自然语言描述来定位 3D 场景中的对象。虽然利用视觉语言模型 (VLM) 的最新进展探索了零样本的可能性,但它们通常会受到依赖于预处理 3D 点云的静态工作流程的影响,从本质上降低了提案匹配的基础。为了绕过这种依赖,我们的核心动机是解耦任务:利用 2D VLM 来解决复杂的空间语义,同时依靠确定性多视图几何来实例化 3D 结构。在这种见解的驱动下,我们提出了“思考、行动、构建(TAB)”,这是一种动态代理框架,它将 3D-VG 任务重新表述为直接在原始 RGB-D 流上运行的生成 2D 到 3D 重建范例。具体来说,在专门的 3D-VG 技能的指导下,我们的 VLM 代理动态调用视觉工具来跨 2D 帧跟踪和重建目标。至关重要的是,为了克服严格的 VLM 语义跟踪造成的多视图覆盖缺陷,我们引入了语义锚定几何扩展,这种机制首先将目标锚定在参考视频剪辑中,然后利用多视图几何在未观察到的帧中传播其空间位置。这使得代理能够通过相机参数聚合这些多视图特征,直接将 2D 视觉线索映射到 3D 坐标,从而“构建”目标的 3D 表示。此外,为了确保严格的评估,我们识别现有基准中的引用模糊性和类别错误等缺陷,并手动优化不正确的查询。 ScanRefer 和 Nr3D 上的大量实验表明,我们的框架完全依赖于开源模型,显着优于以前的零样本方法,甚至超越了完全监督的基线。