论文

EvolveNav:零样本目标导航的前瞻预反思与自演化记忆

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

上下文与知识记忆Agent记忆

摘要

零样本目标导航(ZS-OGN)要求具身智能体在无任何先验训练下探索并定位目标对象。为此——近期方法利用基础模型。但它们通常依赖静态先验、缺乏适配——导致重复错误与昂贵的试错。本文中——我们提出自演化ZS-OGN框架——实现持续的测试时改进。具体地——我们通过从过去轨迹抽取可行动知识构建智能体规则记忆。然后——我们提出基于置信上界的检索策略——通过平衡语义相关性与历史成功率选择有效规则。此外——我们引入记忆引导的预反思(preflection)模块——在行动前预测潜在结果——减少低效探索。大量实验表明我们的方法超越既有零样本基线——以更少不必要步数取得10.1%成功率提升。

EvolveNav:零样本目标导航的前瞻预反思与自演化记忆:论文配图
图 2. EvolveNav 的方法概述。该架构由两个核心组件组成,用于持续优化。左(情节内反射探索):在测试时执行期间,代理通过从规则库中检索 LLM 驱动的预反射的 top-KK 规则来评估边界 (f1,f2,f3,…,fnf_{1},f_{2},f_{3},\ldots,f_{n})。这可以评估风险以确定最佳方向,从而最大限度地减少试错。右(情节间规则自我演化):在每个导航情节之后,框架从轨迹历史中提取新规则。基于UCB的算法通过平衡信用分配和探索潜力来更新规则权重,不断完善规则库。