论文
通过残余潜在动作学习基于视觉特征的世界模型
Learning Visual Feature-Based World Models via Residual Latent Action
摘要
世界模型根据观察和行动预测未来的转变。现有的作品主要只关注图像生成。另一方面,基于视觉特征的世界模型预测未来的视觉特征而不是原始视频像素,提供了一种更有前景的替代方案,更高效且不易产生幻觉。然而,当前基于特征的方法依赖于直接回归,这导致复杂交互中的预测模糊或崩溃,而高维特征空间中的生成建模仍然具有挑战性。在这项工作中,我们发现可以从 DINO 残差中轻松学习一种新型的潜在动作表示,我们将其称为“残差潜在动作”(RLA)。我们还表明,RLA 具有预测性、可概括性,并且编码时间进展。在 RLA 的基础上,我们提出*RLA World Model* (RLA-WM),它通过流量匹配来预测 RLA 值。 RLA-WM 在模拟和现实数据集上均优于最先进的基于特征的世界模型和视频扩散世界模型,同时比视频扩散快几个数量级。此外,我们开发了两种使用 RLA-WM 来改进策略学习的机器人学习技术。第一个是带有 RLA 的极简世界动作模型,可以从无动作演示视频中学习。第二个是第一个完全在仅从离线视频学习的世界模型中训练的视觉强化学习框架,使用视频对齐奖励,没有在线交互或手工奖励。项目页面:https://mlzxy.github.io/rla-wm