论文
Long-WAM:为实时世界动作模型扩展有效历史上下文
Long-WAM: Scaling the Context of World-Action Models
摘要
实时机器人控制需要足够的视觉历史记录来推断运动和任务进度,但处理该历史记录可能会延迟行动。我们提出了 Long-WAM,一种模型系统框架,用于在实时控制约束下扩展因果世界动作模型的上下文。我们的主要发现是,访问历史记录与使用历史记录不同:当视频基础经过自回归 (AR) 预训练时,较长的历史记录会带来更多回报。我们首先从没有动作标签的机器人和以自我为中心的视频中学习因果预测,然后在世界动作适应过程中保留这种从历史到未来的结构。在 RoboCasa GR-1 上,将上下文从 0.0 秒增加到 19.2 秒,成功率从 63.3% 提高到 78.7%,而双向预训练初始化则没有显示净收益;机器人域 AR 预训练进一步提高了 GR-1 和 LIBERO-Long 的峰值成功率。 Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 上的比较方法中也取得了最佳结果。流式观察编码、异步执行和特定于硬件的加速支持在 RTX 5090、DGX Spark、 和 Jetson AGX Thor 且不放弃未来预测;在 RTX 5090 上,每个动作块(包括未来视频潜在预测)需要 107.4 毫秒。 Unitree G1 和 YAM 上的实时部署支持动态和长范围操作,包括动态杯子堆叠的成功率为 95%,而 Pi0.5 和 Fast-WAM 在 20 次试验中没有一次成功。作为内存通知的执行器,Long-WAM 还补充了复合任务中的更高级别的规划。
