论文

将基础模型搭建为物理世界智能体,推进长程导航能力边界

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

长期物理世界智能体必须对遥远的目标进行推理,同时将决策建立在可靠的闭环行为基础上。当今的基础模型将这些功能分开:视觉语言模型 (VLM) 推断缺失信息并调整高级计划,但在重复导航落地时仍然脆弱且低效,而导航基础模型 (NFM) 稳健地执行语义目标,但作为有界片段运行,没有持久的任务级推理。我们引入了 NavMCP,这是一个代理脚手架框架,它将 VLM 推理代理与 NFM 执行器结合起来,以进行长期探索。 VLM 决定寻找什么证据、在哪里搜索以及何时停止,而 NFM 将每个语义子目标纳入闭环导航。三个渠道构建了他们的协作:意图将证据需求转化为导航调用,观察将推出转化为基于源的轨迹证据,记忆积累了调用中的发现、负面证据和未解决的目标。这种设计将孤立的导航转变成持久的具体交互,而无需重新训练任何一个模型。在具体问答方面,NavMCP 在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得了最先进的结果。在匹配的代理和执行器主干下,它在 HM-EQA 上的性能比情景界面高出 14.9 个百分点。在 Unitree Go2 上,NavMCP 的成功率达到 78.3%,随着任务范围的增加,其与最强基线的差距从 10 点增长到 45 点。这些结果证明了将互补基础模型搭建成长期物理世界代理的潜力。

将基础模型搭建为物理世界智能体,推进长程导航能力边界:论文配图
图1:(a) 直接控制短路点行动的甚低边界线可能会与长视距的进展相矛盾。与NFM相结合,使得VLM可以发布语义导航次级目标,而NFM则进行闭路执行。(b) 关于EQA问题,VLM将寻找证据的决定转换成语义导航呼叫,搜索有关房间,排除不可能找到的区域,并使目标证据本地化。(c) 表1数值将NavMCP与FAST-EQA和相应的基准具体基线进行比较:HM-EQA和Express-Bench工具QA与MT-HM3D记忆-EQA。