论文

Long-WAM:为实时世界动作模型扩展有效历史上下文

Long-WAM: Scaling the Context of World-Action Models

模型训练上下文与知识应用与实践预训练上下文工程机器人

摘要

实时机器人控制需要足够的视觉历史记录来推断运动和任务进度,但处理该历史记录可能会延迟行动。我们提出了 Long-WAM,一种模型系统框架,用于在实时控制约束下扩展因果世界动作模型的上下文。我们的主要发现是,访问历史记录与使用历史记录不同:当视频基础经过自回归 (AR) 预训练时,较长的历史记录会带来更多回报。我们首先从没有动作标签的机器人和以自我为中心的视频中学习因果预测,然后在世界动作适应过程中保留这种从历史到未来的结构。在 RoboCasa GR-1 上,将上下文从 0.0 秒增加到 19.2 秒,成功率从 63.3% 提高到 78.7%,而双向预训练初始化则没有显示净收益;机器人域 AR 预训练进一步提高了 GR-1 和 LIBERO-Long 的峰值成功率。 Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 上的比较方法中也取得了最佳结果。流式观察编码、异步执行和特定于硬件的加速支持在 RTX 5090、DGX Spark、 和 Jetson AGX Thor 且不放弃未来预测;在 RTX 5090 上,每个动作块(包括未来视频潜在预测)需要 107.4 毫秒。 Unitree G1 和 YAM 上的实时部署支持动态和长范围操作,包括动态杯子堆叠的成功率为 95%,而 Pi0.5 和 Fast-WAM 在 20 次试验中没有一次成功。作为内存通知的执行器,Long-WAM 还补充了复合任务中的更高级别的规划。

Long-WAM:为实时世界动作模型扩展有效历史上下文:论文原图
图 1:Long-WAM 概述。 (1)AR视频预训练。 LongLive2.0-Robot 从大约 10,000 个窗口等效小时的机器人和以自我为中心的视频中学习预测动态。 (2)因果适应。我们保留因果视频依赖性,同时根据观察到的历史条件调节动作块去噪。 (3) 上下文缩放。相对于仅当前观察控制,RoboCasa GR-1 的成功率从 63.3% 增加到 78.7%,LIBERO-Long 的成功率从 94.5% 增加到 99.5%,分别在历史记录的 19.2 秒和 2.4 秒处达到峰值。 (四)高效部署。异步执行、流式 VAE 编码、决策时间预填充、调用内 KV 重用和特定于硬件的加速可实现对 RTX 5090、DGX Spark 和 Jetson AGX Thor 的实时控制。