论文

Faster-WAM:世界动作模型需要深层动作模块吗?

Faster-WAM: Do World Action Models Need Deep Action Modules?

模型架构Transformer

摘要

世界行动模型(WAMs)将机器人动作预测与视频世界模型相结合。现有的WAMs,共享骨干和混合变换器设计,通常将动作模块的深度与视频骨干的深度绑定,导致巨大的计算开销和高推理延迟。为了解决这一限制,我们引入Dock of Transformer(DoT),一种视频中心的设计原则,将预训练的视频Transformer视为表示中心,并通过Docking接口连接轻量级的输出头。这使灵活的输出头设计成为可能,同时提供从骨干的所有层中直接访问表示的能力。然后,我们引入Faster-WAM,这是一种Dock of Transformer(DoT)的WAM实例,Docking接口将单层的动作头连接到30层的视频骨干。Docking接口融合所有视频层的键和值,并应用RoPE重新定位。在不额外体感预训练的情况下,Faster-WAM在LIBERO和RoboTwin 2.0上表现出竞争性的性能,同时在LIBERO-Plus上展示了强大的泛化能力。Faster-WAM还实现了我们的控制比较中最低的端到端延迟,每帧推理仅需66.5毫秒,比Fast-WAM快3.2倍。总的来说,这些结果表明,视频中心的DoT架构支持灵活的任务特定头设计,同时提供低推理延迟、强大的动作预测性能和稳健的泛化能力。

Faster-WAM:世界动作模型需要深层动作模块吗?:论文配图
(a) 顺序设计消融。(b) 学习的层混合信号。图 3:LIBERO-Plus 上的 Faster-WAM 分析:(a) 顺序设计贡献和 (b) 跨视频层和注意力头的 KV-Fusion 信号。