论文

SceneGraphGrounder:通过结构化场景图匹配进行零样本 3D 视觉基础

SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching

模型推理推理策略与问题分解

摘要

零样本 3D 视觉基础需要通过自由形式的自然语言在非结构化环境中定位对象。最近的视觉语言模型(VLM)方法取得了有希望的结果,但依赖于视图相关推理或隐式表示,限制了组合查询的空间一致性和可解释性。我们提出了 SceneGraphGrounder,一个将 3D 基础重新表述为重构 3D 场景图上的结构化图匹配的框架。为了实现这一表述,我们引入了一种视觉标记提示策略,使 VLM 能够从 2D 视图推断对象-对象关系,随后将其提升为编码空间和语义关系的持久 3D 场景图。给定一个查询,我们构建一个查询图并与场景图执行约束对齐,确保多视图一致性和可解释的推理。 ScanRefer 基准测试的实验表明,我们的方法仅使用 RGB-D 输入即可在零样本方法中实现具有竞争力的性能。我们通过在移动机器人上的实际部署进一步验证我们的框架,在长视距物理环境中展示强大的空间推理能力。我们将在接受后公开我们的代码。