论文

FUS3DMaps:通过体素层和实例层的 3D 融合实现可扩展且准确的开放词汇语义映射

FUS3DMaps: Scalable and Accurate Open-Vocabulary Semantic Mapping by 3D Fusion of Voxel- and Instance-Level Layers

应用与实践视觉感知与空间理解

摘要

开放词汇语义映射使机器人能够在空间上理解以前未见过的概念,而无需预定义的类集。当前的 无需训练 方法通常依赖于语义嵌入到 3D 地图中的多视图融合,要么在实例级别通过分割视图和编码片段的图像作物,要么通过将图像块嵌入直接投影到密集语义地图中。后一种方法通过对完全未裁剪的图像帧进行操作来避开分割和 2D 到 3D 实例关联,但现有方法在可扩展性方面仍然有限。我们提出了 FUS3DMaps,一种在线双层语义映射方法,可在共享体素映射中共同维护密集和实例级开放词汇层。这种设计能够进一步实现层嵌入的体素级语义融合,结合两种语义映射方法的互补优势。我们发现,我们提出的语义跨层融合方法提高了实例级和密集层的质量,同时还实现了可扩展且高精度的实例级映射,其中密集层和跨层融合仅限于空间滑动窗口。对已建立的 3D 语义分割基准以及精选的大型场景进行的实验表明,FUS3DMaps 在多层建筑尺度上实现了准确的开放词汇语义映射。其他材料和代码将提供:https://githanonymous.github.io/FUS3DMaps/。