论文

OVIP-SG:开放词汇实例保留场景图,用于小型、细粒度对象的映射和检索

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

应用与实践视觉感知与空间理解

摘要

将开放词汇感知集成到对象级 3D 场景图中是一把双刃剑。虽然视觉语言检测器可以恢复闭集模型忽略的长尾类别和小而细粒度的对象,但它们也倾向于分割大表面并将小对象合并到更大的相邻对象中,从而损害实例级一致性并破坏映射保真度。此外,现有的方法很难检索以前未映射的目标或确定查询的对象是否不存在,从而阻碍了强大的具体开放世界导航和探索。我们提出了 OVIP-SG,一个用于实例保留语义映射、功能场景分区和语言引导的小细粒度对象检索的统一框架。 OVIP-SG 使用视觉语言模型 (VLM) 枚举特定于场景的类别,以实现稳健的开放世界检测。对称 3D 并交 (IoU) 关联和面积加权特征融合保留小型独立实例,而 VLM 推断的对象函数将场景划分为紧凑的功能搜索区域。四阶段级联检索管道进一步结合体素投票并确定探索覆盖范围内目标的缺失。在 Replica 上的统一评估协议下,OVIP-SG 在类平均准确度 (mAcc) 方面优于 ConceptGraphs 6.31 点,在频率加权 mIoU (F-mIoU) 方面优于 ConceptGraphs 5.15 点,同时实现了 0.398 的类无关本机实例全景质量 (PQ)。它将搜索区域减少到室内地板空间的 21.8%,并达到物体存在分类的 0.773 平衡精度。现实世界的机器人实验进一步证明了其实际有效性。代码可在 https://github.com/Agibot-Spatial-Intelligence/OVIP-SG 获取。