论文
将基础模型搭建为物理世界智能体,推进长程导航能力边界
Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation
摘要
长期物理世界智能体必须对遥远的目标进行推理,同时将决策建立在可靠的闭环行为基础上。当今的基础模型将这些功能分开:视觉语言模型 (VLM) 推断缺失信息并调整高级计划,但在重复导航落地时仍然脆弱且低效,而导航基础模型 (NFM) 稳健地执行语义目标,但作为有界片段运行,没有持久的任务级推理。我们引入了 NavMCP,这是一个代理脚手架框架,它将 VLM 推理代理与 NFM 执行器结合起来,以进行长期探索。 VLM 决定寻找什么证据、在哪里搜索以及何时停止,而 NFM 将每个语义子目标纳入闭环导航。三个渠道构建了他们的协作:意图将证据需求转化为导航调用,观察将推出转化为基于源的轨迹证据,记忆积累了调用中的发现、负面证据和未解决的目标。这种设计将孤立的导航转变成持久的具体交互,而无需重新训练任何一个模型。在具体问答方面,NavMCP 在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得了最先进的结果。在匹配的代理和执行器主干下,它在 HM-EQA 上的性能比情景界面高出 14.9 个百分点。在 Unitree Go2 上,NavMCP 的成功率达到 78.3%,随着任务范围的增加,其与最强基线的差距从 10 点增长到 45 点。这些结果证明了将互补基础模型搭建成长期物理世界代理的潜力。
