论文
Faster-WAM:世界动作模型需要深层动作模块吗?
Faster-WAM: Do World Action Models Need Deep Action Modules?
摘要
世界行动模型(WAMs)将机器人动作预测与视频世界模型相结合。现有的WAMs,共享骨干和混合变换器设计,通常将动作模块的深度与视频骨干的深度绑定,导致巨大的计算开销和高推理延迟。为了解决这一限制,我们引入Dock of Transformer(DoT),一种视频中心的设计原则,将预训练的视频Transformer视为表示中心,并通过Docking接口连接轻量级的输出头。这使灵活的输出头设计成为可能,同时提供从骨干的所有层中直接访问表示的能力。然后,我们引入Faster-WAM,这是一种Dock of Transformer(DoT)的WAM实例,Docking接口将单层的动作头连接到30层的视频骨干。Docking接口融合所有视频层的键和值,并应用RoPE重新定位。在不额外体感预训练的情况下,Faster-WAM在LIBERO和RoboTwin 2.0上表现出竞争性的性能,同时在LIBERO-Plus上展示了强大的泛化能力。Faster-WAM还实现了我们的控制比较中最低的端到端延迟,每帧推理仅需66.5毫秒,比Fast-WAM快3.2倍。总的来说,这些结果表明,视频中心的DoT架构支持灵活的任务特定头设计,同时提供低推理延迟、强大的动作预测性能和稳健的泛化能力。
