VOIM:无需训练 用于 RGB-D 和单目 SLAM 的开放词汇 3D 实例映射
VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM
摘要
我们提出了基于体素的在线实例管理器(VOIM),这是一个基于 无需训练 体素的实例管理器,它从 RGB-D 或仅从单目 RGB 构建开放词汇 3D 实例图,这是先前 无需训练 系统无法解决的机制。在线系统通常会在第一次检测时对对象实例进行分段并对其进行标记,并在证据最弱时进行提交。相反,VOIM 会推迟标签和实例决策,直到来自视图中每个体素的未经修改的现成感知的软证据积累起来。我们证明了映射阶段,而不是特定的感知模型,带来了结果:在 ScanNet++ 上的四种感知配置中,改变区域描述符、检测器标签先验和掩模源,映射超过了最强的在线 RGB-D 系统 OVO-SLAM 4.8 到 11.7 mIoU。感知不是中性的,并且替换该基线自己的描述符族会花费 4.1 的裕度,但基线携带稍微更好的 2D 描述符(三个场景中的 33.7 mIoU 与 31.5 mIoU),并且仍然实现较弱的贴图。在同类协议下,VOIM 在 ScanNet++ 上达到 44.07 mIoU,而在 ScanNet++ 上为 32.37,赢得了所有 10 个场景和两种聚合(汇总为 33.31 对 25.97),并且同一系统在完全单目 RGB 上运行不变,与 Replica 上汇总的基线相匹配(27.80 对 27.50)。优势是特定于制度的:在 Replica 的所有类别评分下,匹配的输入会给出分裂结果,每个场景平均值为 28.60 与 27.50,而 24.59 与 30.11 相结合。房间规模受到标签限制,建筑规模漂移受到限制。标签不是实时运行的,主要是对整个词汇表进行每类检测。这些地图导出占用网格并解析对对象实例的自由格式查询。