论文

机器人导航

Robostral Navigate

摘要

大规模部署导航系统需要一种方法,可以最大限度地减少传感器假设、概括机器人实施例并进行有效训练。然而,当今最好的系统依赖于深度传感器、多摄像头设备或预构建地图,限制了它们支持的硬件并增加了部署成本。我们推出 Robostral Navigate,这是一种围绕此可扩展性目标构建的 8B 视觉语言模型。该模型仅消耗单目 RGB 图像流(机器人平台上最普遍的传感器),并通过指向当前相机视图中的下一个目标位置来预测路径点。纯粹在图像空间而不是特定于机器人的坐标中操作,使得该策略自然地对相机内在特性和场景规模的变化具有鲁棒性,从而无需重新校准即可在轮式、腿式和空中机器人上进行部署。我们在 35 万个模拟场景中生成 240 万条轨迹,以减少对现实世界数据收集和轻松扩展的依赖。我们进一步引入了前缀缓存训练方案,将整个剧集打包到单个训练序列中,将训练词元减少 22 倍,并将训练时间从几个月缩短到几天。基于树的注意力掩模可以防止对之前的 真值 动作进行调节,鼓励基于视觉的动作预测,并使用强化学习来进一步提高探索和恢复能力。在连续环境中的房间到房间和房间跨房间(R2R-CE 和 RxR-CE)基准上,Robostral Navigate 树立了新的技术水平。在 R2R-CE 上,它实现了 77.4% 的成功率,尽管只使用单个 RGB 摄像头,但比最好的单目方法高出 10.5 个点,比最强的深度或多摄像头系统高出 5.3 个点。在 RxR-CE 上,它的成功率达到 75.1%,优于所有单眼基线。