论文
通过世界行动模型加强政策学习
Enhancing Policy Learning with World-Action Model
摘要
本文提出了世界动作模型(WAM),这是一种动作规范化的世界模型,它联合推理未来的视觉观察和驱动状态转换的动作。与仅通过图像预测训练的传统世界模型不同,WAM 将逆动态目标纳入 DreamerV2,预测潜在状态转换的动作,鼓励学习的表示捕获对下游控制至关重要的动作相关结构。我们评估了 WAM 在增强 CALVIN 基准的八个操纵任务中的政策学习方面的作用。我们首先通过世界模型潜伏的行为克隆来预训练扩散策略,然后在冻结的世界模型中使用基于模型的 PPO 对其进行改进。在不修改策略架构或训练程序的情况下,WAM 将平均行为克隆成功率从 DreamerV2 和 DiWA 基线的 59.4% 提高到 71.2%。在 PPO 微调 之后,WAM 的平均成功率为 92.8%,而基线为 79.8%,其中两项任务达到 100%,训练步骤减少了 8.7 倍。