论文
面具世界模型:预测对于鲁棒机器人策略学习来说重要的事情
Mask World Model: Predicting What Matters for Robust Robot Policy Learning
摘要
来自大规模视频生成 预训练 的世界模型已成为通用机器人策略学习的有前途的范例。然而,标准方法通常侧重于高保真 RGB 视频预测,这可能会导致对不相关因素的过度拟合,例如动态背景和照明变化。这些干扰降低了模型的泛化能力,最终导致控制政策不可靠且脆弱。为了解决这个问题,我们引入了掩模世界模型(MWM),它利用视频扩散架构来预测语义掩模而不是像素的演变。这种转变带来了几何信息瓶颈,迫使模型捕捉必要的物理动力学和接触关系,同时滤除视觉噪声。我们将此掩模动态主干与基于扩散的策略头无缝集成,以实现强大的端到端控制。广泛的评估证明了 MWM 在 LIBERO 和 RLBench 模拟基准上的优越性,显着优于最先进的基于 RGB 的世界模型。此外,现实世界的实验和鲁棒性评估(通过随机词元修剪)表明,MWM 表现出卓越的泛化能力和对纹理信息丢失的强大恢复能力。