论文

WAM-Cache:用于高效世界操作模型的过时限制 KV 重用

WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models

模型推理推理加速KV Cache

摘要

世界动作模型 (WAM) 通过根据预先训练的视频扩散Transformer (DiT) 的表示来调节动作专家,从而实现通用机器人操作。在闭环控制中,视频 DiT 在每个块上运行,将当前观察结果编码为动作专家查询的分层键值 (KV) 对。这种预填充主导了每块的计算成本,但现有的免训练加速使其完全密集。我们提出了 WAM-Cache,这是一个免训练的框架,它保留跨块的分层键值表示,并仅重新计算稀疏刷新的token集。至关重要的是,我们发现刷新视觉漂移token的直观启发法远低于密集基线,即使有预言机预测真值 KV 漂移。相反,下游动作的准确性取决于动作专家参与的位置,而不是移动的内容。因此,WAM-Cache 通过将动作专家的交叉注意力与视觉潜在惊喜相结合来选择刷新集,并辅以严格的年龄限制来抑制复合错误。在 Fast-WAM 上, WAM-Cache 在 RoboTwin 2.0、LIBERO 和实际实验中将视频 DiT 预填充 FLOP 减少了 32-42%,同时与模拟中的密集策略相比保持在 0.7-1.8 个百分点以内,与真实机器人相比则保持在 2.5 个百分点以内。