论文

Faster-WAM:强大的世界行动模型的高效推理时间未来调节

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

模型推理推理加速

摘要

世界行动模型 (WAM) 通过了解环境如何演变超出当前观察范围来改进机器人操作。然而,现有方法面临着一个根本性的困境:联合 WAM 在推理过程中保留了未来感知的表示,但会产生高昂的计算成本,而高效的替代方案则在推理时消除了未来建模,并可能失去时间推理的鲁棒性优势。在这项工作中,我们重新审视了 WAM 中未来表示的作用,并表明推理时的未来条件对于分布变化下的泛化至关重要。这一观察结果激发了 Faster-WAM,这是一种高效的未来调节 WAM,可以保留未来的表示,同时避免昂贵的视频动作交互。 Faster-WAM 引入了一个稀疏的未来条件框架,该框架计算一次未来表示,并在整个动作去噪过程中选择性地重用它们。具体来说,我们提出 SparseMoT 在网络阶段的紧凑子集中用选择性视频动作交互取代普遍存在的分层融合,并提出 Interval KV-Fusion 来聚合多深度未来表示而不增加注意力复杂性。实验表明,Faster-WAM 比现有的 WAM 实现了更好的性能与效率权衡。在发行版 LIBERO-Plus 基准测试中,与 Fast-WAM 相比,Faster-WAM 将成功率从 49.14% 提高到 73.57%,同时运行速度比 Joint-WAM 快 2.21$\times$。它进一步在 LIBERO 和 RoboTwin 2.0 上实现了最先进的性能,同时在现实世界的操作中表现出强大的鲁棒性。