论文

开放词汇场景映射的场景语言模型

A Scene Language Model for Open-Vocabulary Scene Mapping

摘要

开放词汇 3D 场景映射旨在构建环境中对象的持久表示。现有系统通常依赖于工程制图管道来关联观察结果、合并视图之间的信息,并随着时间的推移保持一致的场景表示。许多还存储功能丰富的对象表示,例如嵌入或图像裁剪,从而增加了持久内存的大小和复杂性。我们引入了 SceneLM,一种直接维护文本场景地图的场景语言模型。完整场景表示为对象的结构化文本列表,它作为模型唯一的持久内存。对于每个输入图像,模型读取当前场景状态并通过添加、编辑和删除对象来更新地图。为了学习这种行为,我们引入了用于迭代场景地图维护的监督任务以及自动注释管道,该管道从没有人工标签的图像中生成训练数据。我们根据基于语言的检索基准和本地化基准来评估 SceneLM。在这两个基准测试中,该模型生成的场景地图可通过由专用感知和几何模块构建的完整地图系统实现具有竞争力的性能,同时生成更紧凑 6-12 倍的场景表示。我们通过四足动物上的实验进一步证明了 SceneLM 可以在边缘设备上在线运行。这些结果表明,仅使用轻量级文本表示的单一视觉语言模型可以直接维护持久的开放词汇 3D 场景图。此 https URL 上提供了训练和推理代码。