论文

RoboAtlas:上下文主动 SLAM

RoboAtlas: Contextual Active SLAM

摘要

我们提出了 RoboAtlas,一个上下文主动 SLAM 框架,它使用可扩展的 3D 语义映射系统 OpenRoboVox 自适应地平衡几何探索和语义推理。 RoboAtlas 通过上下文多臂老虎机集成了前沿探索、全局语义地图推理和基于自我中心的 VLM 推理,随着场景理解的提高,该老虎机从探索过渡到语义引导导航。我们在超过 1800 平方米的大型现实环境中的仿真和 Unitree Go2 机器人上评估系统,大约。 30k 映射语义实例,实现 100% 的任务成功率。在 GOAT-Bench“Val Unseen”基准上,RoboAtlas 使用 GPT-4o 实现了最先进的性能,报告的最高成功率 (SR) 为 90.6%,与之前最强的基线相比,SR 提高了 17.8 个百分点。使用更小的 Qwen2.5-VL-7B 模型,它仍然达到 88.8% SR,优于在 SR 中使用 GPT-4o 的所有基线,并揭示了通过我们的语义映射框架获得的信息相对于简单替换底层基础模型的重要性。结果表明,具有大规模 3D 语义图的基础模型可实现稳健且高效的上下文主动 SLAM。