论文

RealtimeWAM:加速世界动作模型的实时机器人控制

RealtimeWAM: How Fast Can I Run My World Action Model?

模型推理应用与实践推理加速批处理与并行机器人

摘要

世界动作模型 (WAM) 将视觉动力学建模与动作生成相结合,但其高推理延迟限制了响应式机器人控制。最近的努力通过在测试时消除显式的未来视频生成来加速推理,如 FastWAM,这种方法需要专门定制的架构设计。更通用的缓存策略利用特征冗余,但仅冗余并不能捕获闭环控制不断变化的计算需求。为了应对这些挑战,我们提出了 RealtimeWAM,这是一种通用的免训练框架,可协调并行执行与自适应计算,以实现跨不同 WAM 架构的低延迟推理。我们利用分层依赖性将观察处理与预测重叠。然而,并发分支仍然会争夺 GPU 资源,限制了并行执行的优势。因此,我们通过选择性重用、缓存视觉稳定区域中的观察特征以及重用 Transformer 残差来调整整个流程的计算,同时保留额外的细化 预测的小调整。我们在 RoboTwin、LIBERO 和 LIBERO-Plus 上评估 FastWAM 和 OpenWAM 上的 RealtimeWAM。在 RTX 4090 上,测得的平均推理延迟分别为 24.09 和 63.09 毫秒,对应的平均加速分别为 8.90$\times$ 和 10.67$\times$。平均成功率分别为 82.75% 和 87.41%,与本机推理相差 0.02 和 0.53 个百分点。在五个实际任务中,RealtimeWAM 在 FastWAM 和 OpenWAM 上比本机推理的平均成功率分别提高了 17.2 和 37.2 个百分点。

RealtimeWAM:加速世界动作模型的实时机器人控制:论文原图
图 1:使用 RealtimeWAM 进行响应式机器人控制。左:在传送带上堆放三个羽毛球需要快速响应场景变化。右图:表 4 中 RTX 4090 上该任务的平均测量推理延迟。虚线标记了根据经验观察到的传送器任务阈值,约为 90 毫秒,超过该阈值任务成功率显着降低(附录 A)。