论文
RealtimeWAM:加速世界动作模型的实时机器人控制
RealtimeWAM: How Fast Can I Run My World Action Model?
摘要
世界动作模型 (WAM) 将视觉动力学建模与动作生成相结合,但其高推理延迟限制了响应式机器人控制。最近的努力通过在测试时消除显式的未来视频生成来加速推理,如 FastWAM,这种方法需要专门定制的架构设计。更通用的缓存策略利用特征冗余,但仅冗余并不能捕获闭环控制不断变化的计算需求。为了应对这些挑战,我们提出了 RealtimeWAM,这是一种通用的免训练框架,可协调并行执行与自适应计算,以实现跨不同 WAM 架构的低延迟推理。我们利用分层依赖性将观察处理与预测重叠。然而,并发分支仍然会争夺 GPU 资源,限制了并行执行的优势。因此,我们通过选择性重用、缓存视觉稳定区域中的观察特征以及重用 Transformer 残差来调整整个流程的计算,同时保留额外的细化 预测的小调整。我们在 RoboTwin、LIBERO 和 LIBERO-Plus 上评估 FastWAM 和 OpenWAM 上的 RealtimeWAM。在 RTX 4090 上,测得的平均推理延迟分别为 24.09 和 63.09 毫秒,对应的平均加速分别为 8.90$\times$ 和 10.67$\times$。平均成功率分别为 82.75% 和 87.41%,与本机推理相差 0.02 和 0.53 个百分点。在五个实际任务中,RealtimeWAM 在 FastWAM 和 OpenWAM 上比本机推理的平均成功率分别提高了 17.2 和 37.2 个百分点。
