DreamWAM:超越 RGB 对世界动作模型的未来预测
DreamWAM: Beyond RGB Future Prediction for World Action Models
摘要
世界行动模型(WAM)通过预测观察到的世界将如何演变来学习与行动相关的表示。大多数现有的 WAM 在 RGB 空间中定义了这个未来,其中与任务相关的状态转换与纹理、照明、背景和视点的令人讨厌的变化纠缠在一起。我们认为 WAM 应该明确预测与动作相关的未来状态,而不是仅仅依赖 RGB 预测。我们引入了 DreamWAM,它将未来预测重新表述为超越 RGB 的结构化世界建模,通过外观、运动、几何和语义的互补视图来表示未来状态。在训练过程中,DreamWAM 将 RGB 和运动的联合潜在去噪与几何和语义的轻量级门控残差分支相结合。 VideoDiT 和 ActionDiT 之间的共享注意力允许操作分支从这些未来状态预测中学习,而所有超出 RGB 的监督分支在推理时都被禁用,并且部署仍然仅限 RGB。在无视频预测轨迹和联合视频动作推理中,DreamWAM 持续改进了 LIBERO 上匹配的仅 RGB 基线,分别从 97.30\% 到 98.40\% 和从 98.00\% 到 98.90\%。在未见的 LIBERO-Plus 扰动下,增益变得更大,从 51.36\% 到 63.44\%,从 69.16\% 到 75.47\%。同样的鲁棒性也延伸到了现实世界的操作中,在光照、背景和对象布局的不可见变化中,DreamWAM 的平均成功率为 74.4%,而 Fast-WAM-Joint 的平均成功率为 55.6%。这些结果表明,强大的世界行动学习不仅取决于预测未来,还取决于以对行动重要的形式表示未来。代码和模型在 https://github.com/hustvl/DreamWAM 上公开发布。