论文

ZimaBlue:通过可扩展视频发展可推广的世界行动模型 预训练

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

模型训练预训练

摘要

机器人操纵面临着根本性的规模挑战:强大的泛化需要广泛的物理经验,但带有动作标记的机器人轨迹的收集成本很高,并且多样性本身就受到限制。以自我为中心的视频提供了更具可扩展性的具体体验来源,捕捉不同环境中的对象交互、接触动态、工具使用和长期行为。核心挑战是如何将这种丰富但无需行动的体验转化为有效的机器人控制。我们介绍了 ZimaBlue,这是一个可扩展的框架,用于从大规模视频中学习通用的世界动作模型(WAM)。 ZimaBlue 遵循三阶段训练课程:首先在大规模人类和机器人自我中心视频上执行因果体现视频 预训练,然后通过具有统一动作表示的视频动作中间训练,将学习到的视觉动态融入异构机器人轨迹中,最后将模型专门用于目标机器人进行部署。为了使生成式 WAM 适用于实时控制,ZimaBluefurther 采用了异步 Slow-Fast 双系统架构,其中大容量 Slow world 模型提供了通用的时空表示,轻量级 Fast 分支在 NVIDIA RTX 4090 上实现了 30 Hz 动作预测。在真实机器人零样本评估中,从单独的目标机器人数据扩展到超过 120,000 小时的具体视频,可提高成功率36.1%至77.8%。 ZimaBlue 在多个基准测试中进一步提供了强劲的性能,尤其是在未见过的任务上取得了特别明显的进步。