GE-Act 2.0:预训练和扩展机器人操作的世界动作模型
GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
摘要
世界动作模型 (WAM) 预测未来状态以指导机器人动作,从而能够从无动作视频和动作标记交互中进行学习。大多数继承了预训练的视频生成器,而 WAM 预训练和缩放尚未得到充分探索。我们引入 Genie Envisioner Act 2.0 (GE-Act 2.0),这是一种世界动作模型,其可训练的生成和动作组件都是根据操作数据从头开始初始化的。它结合了面向控制的自动编码器 (CoAE)、单步视觉规划器 (SVP) 和逆动态模型 (IDM)。 CoAE 在积极压缩下保留了与动作和指令相关的信息,而 SVP 在一次可微分过程中生成完整的未来状态,因此视觉规划和逆动态可以在补充数据上单独进行预训练。然后,这些组件通过知识对齐选择性优化(KASO)进行联合训练,通过仅选择与记录的行为相一致的预测未来来减少不匹配的监督。我们直接评估预训练检查点,无需针对每个任务 微调,对 20 个操作技能组的 100 个任务进行评估,并保留场景、背景、照明和对象实例。将协同训练数据从 300 小时扩大到 30,000 小时,G1-OP 的成功率从 17.1% 提高到 44.1%,G2-90D 的成功率从 13.4% 提高到 31.1%;尽管 G2-90D 只占协同训练数据的不到 2%,但它还是提高了 17.7 个点,表明可以进行跨实体迁移。收益跨越 19/20 和 18/20 技能组,特定技能的覆盖范围与零样本分布外 (OOD) 成功密切相关(Pearson r=0.80;Spearman rho=0.85)。在相同的协议下,该模型在至少 90% 的试验中基于对象、颜色、形状和位置参考,并遵循明确的指令,即使它们与已经承诺的行为或传统场景关联相冲突。