论文
HarnessVLN:通过代理 Harness 统一免训练实体导航
HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
摘要
具身导航要求智能体在空间观察中遵循指令或目标目标,并将计划转化为成功的执行。随着多模态大语言模型(MLLM)的能力越来越强,它们无需特定任务的训练即可为导航提供更强大的支持;然而,仅改进语义推理并不能确保提议的行动与空间证据、任务进度和执行结果保持一致。我们引入了 HarnessVLN,这是一个零样本、免训练的框架,它通过共享的 Agent Harness 统一了指令跟踪和对象目标导航。 Harness 通过统一的界面协调感知、记忆和执行工具,在调度之前验证规划者建议的证据支持、几何可行性和子目标一致性。它共同管理分层事件内存和持久时空图,以跟踪任务进度、保留空间证据并将失败情境化。结构化执行反馈更新此共享状态,指导后续计划、恢复和终止。在 R2R、RxR、HM3D-v2 和 HM3D-OVON 中,HarnessVLN 的成功率分别为 60.8%、53.9%、76.0% 和 59.3%,优于先前免训练的最先进方法。人形机器人的部署进一步证明了其对现实环境中导航任务的适用性。该项目页面位于 https://agibot-harnessvln.netlify.app/。