论文

用于统一世界建模的蒙面视觉动作

Masked Visual Actions for Unified World Modeling

模型推理解码与生成控制

摘要

视频模型吸收了有关视觉世界如何移动、交互和接触响应的丰富先验知识,使它们成为机器人世界建模的有希望的基础。核心挑战是如何以与视觉空间一致的形式向这些模型传达动作,在视觉空间中模型学习了这些交互先验,但仍然以物理操作为基础。我们引入了 Masked Visual Actions,这是一种像素空间控制界面,它将动作表示为视频中任意实体的部分显示轨迹。揭示机器人运动使模型充当前向动力学模型,预测场景对低级机器人动作的响应,同时揭示所需的物体运动使同一模型恢复与该结果一致的机器人行为。仅使用来自真实视频和模拟的 15 小时蒙版示例进行微调,单个检查点即可在不同场景和多个实施例中实现强大的视觉保真度和可控性。在下游操纵设置中,该模型产生想象轨迹,其结果与政策评估的现实执行相关,通过在基于模型的规划中对候选未来进行排名来改进决策,并通过从所需的物体运动合成机器人运动来支持逆向建模。