论文
FSUNav:一种用于快速、安全和通用零样本目标导向导航的大脑-小脑架构
FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation
摘要
当前的视觉语言导航方法在异构机器人兼容性、实时性能和导航安全性方面面临着巨大的瓶颈。此外,他们努力支持开放词汇语义概括和多模式任务输入。为了应对这些挑战,本文提出了 FSUNav:一种用于快速、安全和通用的零样本目标导向导航的大脑-小脑架构,该架构创新地将视觉语言模型(VLM)与所提出的架构集成在一起。小脑模块是高频端到端模块,开发基于深度强化学习的通用局部规划器,实现跨异构平台(例如人形、四足、轮式机器人)的统一导航,提高导航效率,同时显着降低碰撞风险。大脑模块构建了三层推理模型,并利用VLM构建端到端检测和验证机制,无需预定义ID即可实现零样本开放词汇目标导航,并提高模拟和现实环境中的任务成功率。此外,该框架支持多模式输入(例如文本、目标描述和图像),进一步增强泛化性、实时性能、安全性和鲁棒性。 MP3D、HM3D 和 OVON 基准测试的实验结果表明,FSUNav 在对象、实例图像和任务导航方面实现了最先进的性能,显着优于现有方法。在不同机器人平台上的实际部署进一步验证了其稳健性和实际适用性。