论文

TRACKGRAPH:以二维跟踪维护开放词汇三维场景图

TRACKGRAPH: Online Open-Vocabulary 3D Scene Graphs via Image-Space Tracking

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 地图使机器人能够使用自然语言推理以前未知的环境。然而,现有系统通常会对每个传入图像进行分段,将检测与持久的 3D 分段相关联,并经常执行成本高昂的视觉语言 (VL) 推理。我们提出了 TRACKGRAPH,这是一个在线开放词汇系统,可在将片段融合为 3D 之前直接在图像流中维护短期 2D 掩模标识。 FastSAM 掩模和 CLIP 特征在稀疏关键帧处计算,而密集的 DINOv3 特征用于在其间以高速率传播掩模。生成的跟踪蒙版被融合到分层场景图中的与类无关的 3D 分段层中,并通过 3D 关联处理跟踪中断和长期重访。紧凑的多视图 CLIP 嵌入可实现开放词汇检索。在 Replica、ScanNet++ 和 HM3D 中,TRACKGRAPH 实现了与最先进的映射方法相比具有竞争力的开放词汇分割和检索,包括 Replica 上最高的同义词频率 (0.50)。在相同的 NVIDIA A100 上,它比 ViT-H OVI-MAP 快 1.7 倍,使用的 GPU 内存少 3.3 倍。现实世界的四足动物部署演示了机载场景图构建和 7.5Hz 的对象搜索,同时记录的无人机数据用于在空中视角下测试该方法。

TRACKGRAPH在机器人探索时融合二维跟踪与三维片段,构建开放词表场景图。
图1(图注摘要):TRACKGRAPH在机器人探索时融合二维跟踪与三维片段,构建开放词表场景图。