论文

InternW0-Δ:融合多种预训练先验的世界动作模型

InternW0-$Δ$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data

模型架构混合架构

摘要

世界动作模型 (WAM) 联合模拟通用机器人操作的视觉动力学和动作生成。一个核心挑战是将大规模预训练模型的先验(包括视觉动力学、场景语义、几何和运动)集成到机器人动作生成的统一框架中。我们推出了 InternW0-$Δ$,这是一种在异构语料库上进行预训练的统一 WAM,其在模拟基准测试和真实机器人平台上的性能优于现有方法。 InternW0-$Δ$ 在混合Transformer (MoT) 框架内结合了预训练的视觉动力学、场景级语义、4D 几何和运动先验以及动作生成。预训练的视频专家和动作专家在冻结的 VLM 的语义指导下进行交互,而预训练的 4D 基础模型则通过仅在训练阶段使用的蒸馏注入几何和运动先验。我们进一步介绍了因果印记,它从仅在训练阶段使用的未来监督中学习与未来相关的场景变化,并直接向动作专家提供预测表示,而无需在推理时展开未来视频预测。对于大规模联合训练,我们构建了一个由机器人演示、UMI 数据、以自我为中心的人类演示和 Ego2Robot 数据组成的异构语料库,并在通用的状态-动作表示下进行整理和对齐。由此产生的语料库包含超过 20K 小时的已处理训练数据,据我们所知,这是同类中最大的开源语料库。我们在此语料库上预训练 InternW0-$Δ$,并在模拟基准和真实机器人平台上展示了​​强大的性能。我们将在许可证允许的情况下开源训练代码、模型权重、基础设施、数据处理管道和处理后的数据。项目页面:https://internrobotics.github.io/InternW0-Delta/

InternW0-Δ通过混合Transformer耦合视频与动作专家,并利用语义、几何和运动先验。
图1(图注摘要):InternW0-Δ通过混合Transformer耦合视频与动作专家,并利用语义、几何和运动先验。