论文

直接体验世界模型优化:超越行动模仿来了解世界

Direct Experience World-Model Optimization: Learning the World Beyond Action Imitation

模型训练持续学习

摘要

世界动作模型 (WAM) 将动作生成与物理交互如何展开的预测结合起来。然而,当前的部署后学习范式通常可以改善行为,而不需要更好的世界预测。特别是在灵巧的操作中,小的执行错误可能会在高维动作空间中复合,从而阻碍策略改进并将交互推向世界模型训练分布之外。受此启发,我们提出了直接体验世界模型优化(DEWO),这是一种用于 WAM 的部署后学习范例,它与动作模仿一起,通过视觉体验完善世界表征,以更好地条件动作生成。具体来说,它识别交互转折点,并从成功和失败的未来中学习,以支持无分类器指导。附加值头根据视频表示估计任务进度,并在推理过程中进度停滞时激活指导。在五项 DexJoCo 任务中,DEWO 提高了所有三种 WAM 配方的平均成功率。消融表明,成功和失败的延续的视觉监督可以改善预测和控制,而不仅仅是行动监督。在 Wuji 和 Sharpa 的四项实际任务中,3 x 3 网格评估表明,两轮部署学习将至少一次初步成功的单元中的成功率从 51.0% 提高到 71.7%,提高了 20.7 个百分点。这些发现支持持续的预测学习,通过部署体验来改善控制,使世界建模成为 WAM 适应的积极部分。