论文
SuperNav:适用于任何场景任何任务的 Agentic 导航系统
SuperNav: An Agentic Navigation System for Any Task in Any Scene
摘要
通用服务机器人需要导航系统能够在不熟悉的环境中处理不同的人类请求,将任务通用性与场景通用性结合起来。一些现有方法对多模态大语言模型(MLLM)进行微调来预测导航动作,使其行为依赖于导航训练数据的覆盖范围,并可能限制对新请求和环境的泛化。我们的主要见解是让 MLLM 专注于解释请求、理解场景和做出决策,同时保留其通用功能并将运动执行委托给导航工具。为了实现这个想法,我们引入了 SuperNav,它为预训练的 MLLM 配备了专门的代理工具,无需对 MLLM 进行特定于导航的微调。我们的Harness通过导航技能、面向代理的物理交互工具以及任务进度和上下文管理来支持这些决策。统一的视觉点界面允许模型直接在图像中指定目的地并修改其目标,从而将决策与运动联系起来 根据执行反馈做出决定。这些组件共同支持跨不同任务要求和环境的持续导航。 SuperNav 在实例级、多对象和需求驱动任务方面优于四个评估基准。对 HM3D 的类别级评估以及在真实四足机器人上的部署进一步证明了其跨环境的适用性。项目页面:https://zju3dv.github.io/SuperNav/