论文
XPACE:来自异构经验的联合世界和行动建模
XPACE: Joint World and Action Modeling from Heterogeneous Experience
摘要
通用机器人需要借鉴不同的经验,选择行动,并预测这些行动将如何改变世界。我们引入了 XPACE,这是一个统一的具体世界模型,它既可以作为世界动作模型,联合预测可执行的机器人动作和未来视频,又可以作为世界模拟器,预测指定动作的视觉结果。我们的主要见解是,视频预测既可以将异构经验与行动学习联系起来,又可以为政策改进产生新的经验。通过策略和模拟器之间共享的视频主干,我们使用无动作标记的视频来学习视觉动力学,并使用动作标记的人类和机器人演示来共同学习视频和动作预测。在此架构的基础上,由粗到精的训练课程逐渐强调机器人控制,同时保留人类经验,使策略能够学习机器人演示之外的行为。除了从记录的经验中学习之外,XPACE 还使用其模拟器为保单创建额外的恢复监督。具体来说,我们使模拟器适应其自己生成的上下文,围绕专家演示综合偏差恢复轨迹,并根据过滤的恢复示例微调策略。小鹏汽车 IRON 人形机器人上的实验表明,异构训练提高了鲁棒性,并能够将人类观察到的技能转移到机器人演示中没有的任务上,而模型自身模拟器生成的恢复数据进一步提高了现实世界任务的完成度。这些结果共同证明了联合世界和行动建模如何将异构经验的学习与模拟驱动的政策自我完善联系起来。