论文

用于零样本目标目标导航的分层快慢反应代理

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

智能体系统Agent 架构与控制循环

摘要

零样本目标目标导航(ZSON)要求机器人在其从未进入过的建筑物中找到指定的目标类别。流行的方法使用视觉语言价值图对边界进行评分:每个决策都是当前地图上的另一个 argmax,并且该评分背后的证据在进行时就被丢弃。将大型视觉语言模型放置在感知-动作循环内的系统通常仅从当前视图按固定时间表查询它;机器人几分钟前走过的房间永远不会被重新考虑,失败的呼叫也没有明确的后备措施。我们将机器人已经看到的东西变成审议的对象。我们的分层快慢代理让值映射控制器在每一步运行,并在移动时写入坐标锚定内存:房间类型和已确认对象实例的语义网格,以及姿势标记关键帧的有界存储。 VLM 在写入每个候选检测之前对其进行筛选。审议层以有限的原因-检索-行动循环读取此内存。它唤醒反应层计算的结构事件,首先通过文本进行推理,并仅针对仅靠文本无法分离的候选者回忆第一人称视图。每次调用和每次运行上限限制了其调用,无调用的第一层解决了最频繁的停顿,并且任何故障都将控制权返回给反应控制器。我们的系统在 HM3D v1 val 上达到 68.75% SR,在 MP3D val 上达到 47.29%,这是此处比较的零样本方法中的最高成功率。在所有 2000 个 HM3D 事件的配对比较中,通过 argmax 在远边界中进行选择而不是深思熟虑会花费 3.40 SR 点(95% CI [1.70, 5.05]);对每一个边界的深思熟虑并不能恢复它们。