论文

潜在演变的世界行动模型

Latent evolving World Action Model

模型训练偏好优化

摘要

世界动作模型 (WAM) 联合模拟动作生成和环境动态,并且主要建立在预训练的视频扩散模型 (VDM) 之上。在基于 VDM 的 WAM 中,观察结果首先由 VAE 进行编码,然后由大型视频扩散主干处理生成的压缩潜在变量,以提取用于动作生成的有效特征。然而,这种范例将 WAM 性能和训练成本与大规模视频生成预训练联系在一起,限制了 WAM 效率和可扩展性。在本文中,我们从理论上和实证上研究了视觉表征如何影响 WAM 中的动作生成。我们的结果表明,联合嵌入预测架构 (JEPA) 编码器的预测嵌入比压缩的 VAE 潜伏更好地支持动作生成,其中 I-JEPA 在我们的编码器比较中表现最佳。基于这些发现,我们提出了 LeWAM,它通过预测同一空间中的未来嵌入来调节 JEPA 嵌入的动作生成并模拟环境演化,而不依赖于视频扩散主干。我们进一步发现,模仿学习与演示的动作相匹配,但无法区分更好的动作和更差的动作,尽管小的动作偏差会极大地影响任务的成功。为了解决这一限制,无需额外的环境交互或重置和安全所需的人工监督,我们引入了演示引导 DPO (DemoDPO),这是一个离线偏好细化阶段,可直接从演示中获得偏好监督。仅 0.4B 个可训练参数,LeWAM 在 RoboTwin 2.0 上实现了 92.28% 的平均成功率,与最先进的 VLA 和 WAM 相当,并在现实世界的操作任务中保持了实际效果。