论文

停止徘徊:通过元认知推理进行有效的视觉语言导航

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

智能体系统Agent 架构与控制循环

摘要

无需训练 由基础模型支持的视觉语言导航 (VLN) 代理可以遵循指令并探索 3D 环境。然而,现有方法依赖于贪婪的边界选择和被动空间记忆,导致局部振荡和冗余重访等低效行为。我们认为,这是由于缺乏元认知能力:智能体无法监控其探索进度、诊断策略失败或相应地适应。为了解决这个问题,我们提出了 MetaNav,一种集成了空间记忆、历史感知规划和反射校正的元认知导航代理。空间记忆构建持久的 3D 语义图。具有历史意识的规划会惩罚重访以提高效率。反射校正检测停滞并使用 LLM 生成指导未来前沿选择的校正规则。在 GOAT-Bench、HM3D-OVON 和 A-EQA 上的实验表明,MetaNav 实现了最先进的性能,同时将 VLM 查询减少了 20.7%,这表明元认知推理显着提高了鲁棒性和效率。