论文

OpenWAM:对系统化世界动作模型预训练的开放式模块化探索

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

模型训练预训练

摘要

世界动作模型继承了视频生成先验的世界知识,并通过具体经验将其转化为可执行的控制信号。然而,现有系统是单一的:生成主干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,模糊了哪些设计选择重要以及为什么重要。我们引入了 OpenWAM,这是一个开放的研究堆栈,可将世界动作预训练转变为受控实验程序。 OpenWAM-Infra 将 WAM 设计空间分解为可组合的模块,并具有统一的训练、推理、部署和评估功能。在此基础上,OpenWAM-Study 通过受控实验研究了三个问题:继承什么、世界学习和行动学习如何相互作用以及它们的协同作用如何扩展;并提炼出三个原则:通过足够强大的生成骨干和紧凑、信息丰富的潜在空间进行上游知识转移;世界-行动协同需要专门的行动能力、明确的世界-行动信息流以及同步联合去噪;体现预训练主要提高域外泛化能力,通过整合世界覆盖和行动基础的自我中心和机器人数据的一阶段协同训练。综合这些原则,我们构建了 OpenWAM-α,这是一种开放式 WAM,基于大约 6,400 小时以自我为中心的人类和机器人数据进行了预训练,并通过模拟和现实世界基准进行了评估。在八个模拟基准和真实机器人实验中,涵盖从单臂和双手操作到灵巧手的各种实施例,OpenWAM-α 始终提供出色的性能,维持其从模拟到物理世界的顶级地位。我们发布了完整的堆栈,包括基础设施、评估协议、预训练模型和数据配方,以促进未来的研究。