论文

NavGPT-3:在分层导航运行时中利用上下文

NavGPT-3: Harnessing Context in a Hierarchical Navigation Runtime

智能体系统应用与实践Agent 动作执行与治理Agent Harness机器人

摘要

使用长期 agentic 强化学习训练的语言模型可以通过推理概括知识,表达精确的行动,并通过多个步骤追求目标,从而提高了实体代理可以理解和决定的上限。然而,物理交互仍然是行动策略的领域,它提供密集、低延迟的控制。我们提出了 NavGPT-3,一个连接两个模型的工具,在其之上构建了一个类似操作系统的运行时:推理、执行和监控作为具有自己的上下文、工具和权限的线程运行,而运行时则对它们进行调度并决定哪个线程控制机器人的运动,以便机器人可以通过中断和线程切换对突发的现实事件做出反应。在它下面,我们的动作策略 NavGPT VLA 经过 1928 万个示例的训练,使用编解码器分配来根据场景变化按比例分配视觉标记;仅其 8B 模型在 R2R-CE 上就达到了 74.51 SR,并以 78.19 SR 领先于 RxR-CE。凭借完整的Harness,NavGPT-3 在 R2R-CE (81.51 SR) 上树立了最先进的技术,并首次带来了 达到人类水平的自主代理:在 RxR-CE 上,它在每集 1 分 22 秒内成功匹配人类追随者(90.43 vs. 90.4 SR)和路径保真度(78.47 vs. 77.7 nDTW),而人类则大约需要 3 分钟。我们全面消除了Harness设计和两个模型之间的交互,展示了工具和动作策略如何塑造从语言模型推理到物理控制的路径:当 NavGPT VLA 执行路线时,推理循环缩短,系统的最小反应时间从每个语言模型决策 3-19 秒下降到每个动作策略步骤 0.5-1 秒(1-2 Hz)。这些结果表明,设计这种具体接口对于将前沿语言模型智能与低级物理控制连接起来至关重要。我们将发布所有模型、代码和评估记录。