论文

大脑慢,规划快:抗延迟 VLM 增强城市导航

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation

摘要

基于学习的人行道导航规划器可以实时生成不同的候选轨迹,但它们的评分函数通常无法在具有挑战性的情况下选择最佳轨迹,输出的轨迹使移动机器人驶入草地、驶向行人或驶向错误的方向,即使同一组中存在更好的候选轨迹。我们将其称为轨迹评分差距:在现实世界的人行道导航中,基于锚的规划器的最佳选择与最佳候选之间的差距很大,可能是由于规划器的高级场景理解能力有限。我们提出了一个 VLM-Planner 接口,它使用 VLM 从规划器的建议集中选择候选索引,然后将其与规划器的初始输出融合,而不是用端到端的 Vision-Language-Action 模型替换规划器。然而,VLM 每次查询需要 1--3 秒,因此无法直接驱动 5--20Hz 控制环路。我们贡献了一个 无需训练,延迟弹性轨迹级融合层,通过具有指数衰减的几何相似性将陈旧的 VLM 选择转变为实时规划器评分。在 $\sim$2,000 具有挑战性的现实场景(例如路口、行人相遇)中,与规划者的最佳选择相比,VLM 选择实现了 30% 的 ADE 减少,而规划者在常规情况下仍保持竞争力。在模拟中,Score Fusion 保持 >80% 的成功率,延迟高达 5 秒。我们在移动机器人上演示了完整的系统,该机器人在具有不同网络延迟的具有挑战性的校园人行道上导航。