论文

DualWAM:用于异步全局规划和局部细化的双系统世界行动模型

DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement

智能体系统Agent 架构与控制循环

摘要

世界动作模型 (WAM) 共同生成机器人动作并预测未来的世界状态,将先验从视频预训练转移到机器人控制。然而,未来的视觉预测在计算上是昂贵的,因此现有的 WAM 通常依赖于长动作块来分摊控制步骤之间的推理成本,而代价是闭环响应能力。我们提出了 \ 方法,这是一种双系统 WAM,它可以保留更广阔视野的世界动作生成,同时通过解耦全局规划和局部细化来实现高频闭环动作更新。 \systwo 定期对更广泛的世界动作块执行高噪声双向去噪,以建立全局计划,而仅限手腕的 \sysone 从中间去噪状态中提取时间对齐的短窗口,并使用最新的手腕观察完成低噪声细化,这些观察提供了有关交互过程中局部几何、运动和接触的动作对齐线索。这两个系统沿着共享的去噪轨迹异步运行:每个全局计划在多个本地更新中重复使用,而 \sysone 反复合并新的交互反馈。在 Franka 和 Galbot 的零样本操作任务中,该方法比最强评估基线的成功率平均提高了 4.5 个百分点,同时实现了 16.6 倍的关键路径加速。进一步的研究表明,角色匹配的自我中心和 UMI 数据将成功率提高了 14 个百分点,并且解耦设计自然支持边缘云部署,通信开销比基线低得多。