论文

一个动作值得一个补丁:使用 PatchWAM 进行统一的世界动作建模

An Action Is Worth One Patch: Unified World-Action Modeling with PatchWAM

摘要

生成视觉模型为学习物理动力学的表示提供了基础,但它们对连续控制的扩展提出了一个基本问题:视觉预测和动作生成是否需要单独的计算路径?现有的方法通常引入可训练的动作头或单独的动作专家来桥接低维状态和高维视觉表示。在这项工作中,我们探讨了当动作以兼容的表示形式表达时,视觉主干的现有能力是否也可以支持控制。因此,我们引入了 PatchWAM(补丁世界动作模型),它通过称为“动作即补丁”的固定映射将连续动作视为另一种类型的补丁。这使得单个模型能够预测机器人应该如何移动以及之后的场景可能是什么样子。视觉预测和动作生成成为同一生成过程的一部分,无需专门的动作负责人或单独的动作专家。子采样训练窗口的实验显示出优于匹配的双专家控制的增益,而在带有额外增强演示的全数据设置中,基准评估在 LIBERO-Plus 上达到了 91.8% 的成功率,在 RoboTwin 2.0 上达到了 96.12% 的成功率。更广泛地说,结果表明,不需要在可以继承的地方添加功能:扩展生成主干的约束是写入新信号的接口,而不是对其进行建模的能力。