论文
RepWAM:使用表示视觉动作分词器进行世界动作建模
RepWAM: World Action Modeling with Representation Visual-Action Tokenizers
摘要
这项工作提出了 RepWAM,一种基于表示视觉动作分词器构建的以表示为中心的世界动作模型 (WAM)。现有的 WAM 通常从预训练的视频生成模型继承面向重建的视频分词器。尽管这些分词器保留了视觉保真度,但像素重建本身为学习将未来预测与机器人控制联系起来的指令跟踪动态提供了有限的指导。为了解决这个问题,我们探索了用于以表示为中心的世界动作建模的语义视觉动作潜在空间。具体来说,我们训练一个表示视觉动作标记器,将视觉输入映射到对齐的视觉和潜在动作标记中。然后,我们对 WAM 进行预训练,以联合模拟未来的视觉状态以及在语言指令下连接它们的潜在动作,然后适应真实的机器人轨迹以进行闭环操作。对现实世界操作任务和模拟基准的实验表明,RepWAM 在不同的操作设置中提供了强大的性能,而消融则凸显了语义视觉动作标记化相对于面向重建的替代方案的价值。这些结果将表征视觉动作标记化确立为世界动作模型的有希望的基础,也是迈向通才机器人政策的一步。代码和权重可在 https://github.com/wdrink/RepWAM 获取。