论文
AgentGrounder:使用多模态语言模型的零样本 3D 视觉点云定位
AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
摘要
3D 视觉基础 (3DVG) 是嵌入式 AI 的一项基本功能,要求智能体根据自然语言描述定位 3D 场景中的对象。最近的零样本方法利用了 2D 视觉语言模型 (LVLM)。然而,它们通常依赖于现有的多视图图像集,并且难以应对标准 3D 分割工具提供的有限语义和空间细节。我们提出了 $\textbf{AgentGrounder}$,一个零样本 3D 视觉基础框架,可以直接在彩色点云上运行,无需特定于任务的 3D 训练。我们的方法遵循两阶段设计:(1) 离线阶段,应用 3D 模型构建具有实例 ID、语义标签、3D 边界框的对象查找表 (OLT); (2) 在线工具驱动代理,分解每个查询,仅从 OLT 检索相关候选,执行几何评分,并在需要额外视觉证据(例如颜色、材料或视点敏感线索)时按需触发图像渲染。与固定的锚点-目标匹配管道相比,这种设计通过避免提示因不相关的对象而过载,减少了级联匹配错误并提高了上下文窗口效率。我们在零样本设置下对 ScanRefer 和 Nr3D 进行评估,并在我们的设置中观察到相对于 SeeGround 的一致改进,包括 ScanRefer 上 +2.5% Acc@0.5 和 Nr3D 上 +6.3%,其中 Nr3D 独立于视图的查询显着增加 6.3%。这些结果表明,选择性检索、几何推理和自适应视觉检查的结合为开放词汇 3D 基础奠定了实用且稳健的基础。我们的代码可在 https://github.com/be2rlab/AgentGrounder 获取。