论文
无限之一:将预训练世界模型的未来实现为机器人动作
One from Infinity: Actualizing Futures from Pretrained World Models into Robot Actions
摘要
预训练的视频世界模型承认场景有许多可能的未来,但机器人必须实现精确的任务条件模型。为了将世界模型转化为可执行的机器人策略,现有方法使用大规模机器人数据和计算资源对繁重的世界模型主干进行微调。挑战这一现状,我们认为昂贵的部分已经在世界模型预训练中得到了支付,因为视频世界模型的表示空间展示了多样化的潜在未来。在这种情况下,剩下的就是选择完成任务的未来,并读出实现它的行动。我们将这个任务形式化为实现,它在冻结世界模型提供的先验基础上学习任务条件选择和实现。这可以通过一个微小的实现器模型来解决。我们在冻结世界模型编码器之上实现了 RoboActualizer,参数少至 60M。该实现器由两个轻量级 DiT 专家组成,他们通过流匹配共同预测未来的潜伏和动作。该模型可以完全在具有 32 GB 峰值内存的单个 GPU 上进行训练。 RoboActualizer 的可训练参数比现有 WAM 和 VLA 少了 100 倍,在 LIBERO、LIBERO-Plus、RoboTwin 2.0 和两个真实平台上的五个任务等仿真基准测试中实现了出色的性能,并具有 39 毫秒的低延迟,可实现实时控制。