论文
G2-Nav:用于机器人社交导航的基于视觉依据且具有安全防护的视觉语言成本图
G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation
摘要
社交导航要求机器人在复杂的现实环境中进行推理和响应。虽然最近的工作尝试使用大型视觉语言模型(VLM)将人类水平的智能纳入机器人规划中,但端到端框架通常会创建不可预测的黑匣子,并且现有的指令跟踪方法并不是为完全自主而设计的。为了弥补这一差距,我们提出了 G2-Nav,这是一种新颖的框架,它以抽象的社会推理为基础,并保障现实世界的安全部署。 G2-Nav 没有要求 VLM 直接做出规划决策,而是将其语义推理转化为具有可靠性和可解释性的视觉语言成本图。 VLM 从开放集感知中评估可遍历区域和社会代理,将社会背景映射到成本图中。为了提高现实世界的鲁棒性,VLM 对上游跟踪进行语义验证,并且我们引入了高频安全检查来防止轨迹生成之前的系统延迟。我们通过现实世界的实验证明,G2-Nav 可在非结构化环境中提供安全、高效且符合社会规范的自主导航。代码可在 https://github.com/centiLinda/G2-Nav 获取。