不要丢掉接力棒:通过代理子任务探索和转换感知记忆进行长视野机器人操作
Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory
摘要
长视野机器人操作将许多接触丰富的技能链接到一项多阶段任务中。视觉-语言-行动(VLA)和世界行动模型(WAM)越来越多地掌握个人技能,但链条仍然失败:错误复合超出了政策的纠正能力,并且一个子任务默默地限制了下一个子任务。一条有前途的途径冻结了 VLA,并让 LLM 编码智能体 负责:它以语言进行规划,利用分析原语在自由空间中移动,仅针对接触丰富的片段调用 VLA,并将适应写入语言记忆中。然而,如果将其应用到长远的视野中,这个方法就会失败两次。 (1)它的能力来自于测试时的整体任务探索,其成本与阶段数量呈指数关系:如果一个阶段需要T个episode,那么K阶段的任务需要T^K的量级,并且失败并不能揭示是哪个阶段导致的。 (2) 它没有转换的表示:VLA 原语带有退出但没有进入条件,并且子任务可以以其后继者无法使用的形式成功。我们推出 BATON 来解决这两种失败。与(1)相反,BATON将子任务作为探索的单位:每个子任务都在廉价的短时域中进行探索,并将其解决方案存储在内存中;然后,由这些解决方案组成一个长视野轨迹,而不是发现整个轨迹。勘探成本变为线性(KT),每次失败都归因于一个阶段。与(2)相反,BATON 为探索配备了转换感知记忆。在子任务中,验证者代理控制调用转换:仅在手腕视图确认场景准备就绪后才调用 VLA。在子任务中,切换转换会恢复受前任残留干扰的进入状态,而前瞻转换会选择后继任务可以继承其结果的策略。在 RoboMemArena 基准测试中,BATON 比 SoTA 提高了 37.7% 的任务成功率和 29.7% 的累积成功率。