论文

Vid2WAM:将视频扩散先验蒸馏到世界动作模型

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

摘要

世界动作模型(WAM)通过联合建模未来的视觉动态和动作来改进机器人策略学习。然而,它们的可扩展性和通用性仍然受到对昂贵的专家演示的依赖的限制。我们通过询问 WAM 的未来监督是否必须源自目标任务专家轨迹来挑战这一点。在本文中,我们提出了 Vid2WAM,这是一个离线 蒸馏 框架,它将视觉扩散先验从大型视频基础模型转移到紧凑的 WAM 学生中。给定观察和语言指导,Vid2WAM 通过两个互补渠道提炼监督:以任务为条件的未来预测轨迹直接监督学生的未来预测分支,而逆动力学模型则恢复用于动作学习的机器人形态伪动作。为了稳健地整合合成监督和真实监督,我们引入了源感知残留动作适应,它可以围绕共享动作主干学习源特定的校正,并减轻噪声伪动作的干扰。在推理过程中,视频教师和逆动力学模型都被丢弃,只留下 WAM 学生进行高效部署。仿真和现实实验表明,Vid2WAM 在有限的专家演示下提高了新颖任务的泛化能力和数据效率,同时保持了低延迟推理。