论文
Sparse-WAM:通过行动引导的稀疏想象力加速世界行动模型
Sparse-WAM: Accelerating World Action Models via Action-Guided Sparse Imagination
摘要
世界动作模型 (WAM) 利用预训练的视频模型,通过联合预测未来的视觉状态和动作来提高机器人控制的泛化能力。这种能力需要付出巨大的推理成本,因为在去噪过程中会重复处理密集的未来帧标记。先前的方法通过标记修剪来解决这个问题,标记修剪优先考虑视觉保真度以减少视频扩散模型中的去噪成本。然而,这些方法不使用动作相关性来确定在 WAM 中联合去噪期间保留哪些未来帧标记。在本文中,我们提出了 Sparse-WAM,这是一种用于行动引导的稀疏想象力的免训练框架,它有选择地处理未来帧标记以加速 WAM 推理。我们观察到连续去噪步骤之间从动作标记到未来帧标记(动作到未来注意力)的注意力空间分布存在大量重叠,尽管未来表示不断更新。受此启发,我们开发了动作引导的词元选择,以保留特定于框架的动作相关区域以及跨框架上下文。然而,简单的实现可能会产生注意力评分和词元打包开销,从而抵消了剪枝带来的计算节省。因此,我们引入了 Pilot,这是一种高效的引擎,可以通过轻量级评分和词元选择的跨步骤重用来减少稀疏推理开销。在采用 FastWAM-Joint 的 LIBERO 和采用 Cosmos 3 Edge 的 RoboLab-120 上,与 NVIDIA RTX 4090 上的密集热切推理相比,Sparse-WAM 的推理速度分别提高了约 2.0倍和1.8倍,同时很大程度上保留了任务性能。