论文

2AM:以智能体端记忆指导长程机器人操作的动作模型

2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation

智能体系统Agent 架构与控制循环

摘要

长视野机器人操作需要内存,但不一定在动作策略内。为了解决此类任务,当前的代理系统通常将 VLA 与规划器和几何工具结合起来,有时使用额外的深度或校准的几何形状。这些系统混淆了归因:收益可能来自更丰富的观察或替代的运动工具,而失败可能源于政策或未指定的语言界面。我们通过故意限制的设计来隔离这个问题:较小的工具宽度,但更大的接口带宽。 2AM 使多模式代理成为任务内存的唯一持有者,并使基于 RGB 的、情景无状态的动作模型成为任务相关运动的唯一执行者。代理将交互历史记录编译为子任务语言和可选的 2D 抓取、放置和移动提示,这些提示将其物理意图绑定在不同的时间尺度上。为了向 VLA 教授这种可操纵性,我们使用结构化提示标签来增强演示,并在 dropout、空间噪声和时间抖动条件下进行训练,以容忍不完美的代理输出。在 LIBERO-Mem 上,没有深度、在线几何或基于规划器的物体运动,2AM 的平均完成率达到 76.3%,比报告的最强基线 14.8% 提高了 61.5 分,同时放松成功率为 63.0%,严格成功率为 11.8%。这些结果表明任务内存可以保留在Agent 端。他们进一步表明,行动模型的能力不仅取决于策略所学到的内容,还取决于智能体引导策略的精确程度。