论文
LEXI-SG:具有房间引导前馈重建的单目 3D 场景图映射
LEXI-SG: Monocular 3D Scene Graph Mapping with Room-Guided Feed-Forward Reconstruction
摘要
场景图正在成为机器人导航的标准表示,提供分层几何和语义场景理解。然而,大多数场景图映射方法依赖于深度相机或激光雷达传感器。在这项工作中,我们提出了 LEXI-SG,这是第一个仅使用 RGB 相机输入的开放词汇 3D 场景图的密集单目视觉映射系统。我们的方法利用开放词汇基础模型的语义先验将场景划分为房间,将前馈重建推迟到每个房间都被完全观察到时——从而实现可扩展的密集映射,而不会出现滑动窗口尺度不一致的情况。我们提出了一种基于房间的因子图公式来全局对齐房间重建,同时保持局部地图一致性并自然地施加语义场景图层次结构。在每个房间内,我们进一步支持开放词汇对象分割和跟踪。我们在 Habitat-Matterport 3D 的室内场景和自我收集的以自我为中心的办公室场景中验证 LEXI-SG。我们根据现有的前馈 SLAM 方法以及已建立的场景图基线评估其性能。我们展示了改进的轨迹估计和密集重建,以及开放词汇分割中的竞争性能。 LEXI-SG 表明,仅通过单目 RGB 就可以实现准确、可扩展、开放词汇的 3D 场景图。我们的项目页面和办公室序列可以在这里找到:https://ori-drs.github.io/lexisg-web/。