论文

PreAct-Nav:Agentic城市导航行动前推理

PreAct-Nav: Agentic Reasoning Before Action for Urban Navigation

智能体系统Agent 规划

摘要

城市导航需要具体化的智能体通过基于自我中心观察的局部决策来追求长期目标。然而,现有的Agentic导航方法通常很难将遥远的目标转化为大规模物理环境中连贯的本地决策。他们对短暂观察或有限历史的语言推理的依赖限制了对行动后果和未来条件的预期,尽管这种远见对于在漫长而复杂的城市路线中导航很重要。为了弥补这一差距,我们提出了 PreAct-Nav,这是一种Agentic导航框架,为冻结的策略配备了稳健的城市导航的预期推理。我们的中心思想是将局部决策锚定在持久的中期子目标中,在执行之前评估预测行动的后果,并使用实际结果不断更新推理上下文。导航记忆模块的核心是维护决策中的活动子目标和相关经验,将遥远的目标转化为可操作的中间目标。我们进一步引入了一个预测世界沙箱,它使用动作条件世界模型(AC-WM)来预测以候选者运动为条件的世界动态。视觉语言模型 (VLM) 推理器在当前子目标下解释这些预测,以保留或修改操作。执行后,使用真实的观察结果来评估结果,纠正不一致的假设,并更新记忆以继续或重新制定子目标。广泛的评估表明,所提出的 PreAct-Nav 通过记忆更新和视觉预测改进了动作选择,在更长的路线和更多转弯的路线上有更明显的收益。

PreAct-Nav:Agentic城市导航行动前推理的原论文方法或结果图
图 2:PreAct-Nav 概述。共享VLM通过操作预览、操作审核、操作执行和记忆更新来协调导航记忆和预测沙箱。 记忆提供观察到的经验和当前的子目标;沙箱提供预测的视觉线索。修改后的操作返回预览。执行后,根据预期线索检查实际观察结果,以更新子目标状态和未解决问题的进度。