论文

动作图像:通过多视图视频生成进行端到端政策学习

Action Images: End-to-End Policy Learning via Multiview Video Generation

摘要

世界行动模型(WAM)已成为机器人政策学习的一个有前途的方向,因为它们可以利用强大的视频主干来模拟未来状态。然而,现有的方法通常依赖于单独的动作模块,或者使用非像素基础的动作表示,这使得很难充分利用视频模型的预训练知识,并限制跨视点和环境的传输。在这项工作中,我们提出了 Action Images,这是一种统一的世界动作模型,它将策略学习制定为多视图视频生成。我们没有将控制编码为低维标记,而是将 7-DoF 机器人动作转换为可解释的动作图像:基于 2D 像素并明确跟踪机器人手臂运动的多视图动作视频。这种基于像素的动作表示允许视频主干本身充当零镜头策略,无需单独的策略头或动作模块。除了控制之外,同一统一模型还支持共享表示下的视频动作联合生成、动作条件视频生成和动作标记。在 RLBench 和现实世界评估中,我们的模型实现了最强的零镜头成功率,并比之前的视频空间世界模型提高了视频动作联合生成质量,这表明可解释的动作图像是政策学习的一条有前途的途径。