论文
NavHarness:Agentic 视觉语言导航的自适应目标
NavHarness: Adaptive Goals for Agentic Vision-Language Navigation
摘要
视觉语言导航(VLN)需要具身Agent根据指令和观察生成动作。通用多模态Agent为此任务提供了有希望的基础,但选择合理的本地操作并不能确保执行与预期路线保持一致,特别是在长期任务中。此外,累积的交互历史记录增加了后续决策所需的输入,导致显着的推理开销。为此,我们引入了 NavHarness,一个 Agentic VLN 框架,其中包括为本地操作设置自适应目标的目标Agent、动态验证目标是否已完成的验证Agent、用于多模态上下文压缩的内存Agent以及执行自适应目标的 Visuomotor Agent。具体来说,目标Agent根据指令、当前观察和执行历史来制定自适应目标。然后,Visuomotor Agent 执行导航操作以实现每个目标,而验证 Agent 使用特定于目标的验证问题来动态评估观察到的结果是否满足预期的完成条件。然后,经过验证的目标完成情况标记内存Agent的边界,以压缩相应的多模态交互历史记录,同时保留后续导航所需的信息。我们评估 R2R-CE 和 RxR-CE 上的导航,检查三个模型主干的框架变体,并研究执行过程中的上下文演变。对于真实世界评估,该方法在 8 条具有挑战性的路线(每条路线评估 3 次)中取得了 83.3% 的成功率和 1.51m 的导航误差。