论文
Efficient-WAM:具有低成本未来想象力的 1B 参数世界行动模型
Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination
摘要
通过将未来视觉预测与动作生成相结合,世界动作模型(WAM)已成为一种有前途的体现控制范式。然而,许多现有的 WAM 依赖于逼真的未来预测,这会导致较高的推理延迟,并使实时机器人部署变得困难。我们引入了 Efficient-WAM,这是一种世界动作模型,其动机是即使在视觉保真度较低的情况下,紧凑的未来分支仍然可以支持有效的动作生成。 Efficient-WAM 通过从 WAN-2.2-5B 传输的紧凑视频专家、词元稀疏视频潜伏以及为视频分配比动作更少的采样步骤的非对称视频动作去噪来提高推理效率。 Efficient-WAM 没有优先考虑视觉保真度,而是将未来视频预测视为动作生成的紧凑指导信号。 RoboTwin 2.0 和现实世界操作任务的实验表明,尽管未来预测明显粗糙,Efficient-WAM 仍保持强大的动作性能。我们的 1B 参数模型在物理部署期间每个操作块的耗时为 98 毫秒,比 Motus 基准快 30 倍以上,并且任务成功率相当。