论文

OVI-MAP:开放词汇实例语义映射

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

应用与实践视觉感知与空间理解

摘要

增量开放词汇 3D 实例语义映射对于在复杂的日常环境中运行的自主代理至关重要。然而,由于需要强大的实例分割、实时处理和灵活的开放集推理,它仍然具有挑战性。现有方法通常依赖于闭集假设或密集的每像素语言融合,这限制了可扩展性和时间一致性。我们引入了 OVI-MAP,它将实例重建与语义推理分离。我们建议构建一个与类无关的 3D 实例图,该图是从 RGB-D 输入增量构建的,而语义特征仅使用视觉语言模型从一小组自动选择的视图中提取。这种设计可以在整个在线探索过程中实现稳定的实例跟踪和零样本语义标记。我们的系统实时运行,并且在标准基准上优于最先进的开放词汇映射基线。