论文

用于通用机器人控制的本机视频动作预训练

Native Video-Action Pretraining for Generalizable Robot Control

模型训练预训练

摘要

视频动作模型的出现为机器人控制提供了一条有前途的道路。尽管如此,我们认为重新利用为数字内容创建而设计的视频生成模型本质上不足以适应物理环境。为了弥补这一差距,我们提出了 LingBot-VA 2.0,这是一个从头开始构建的视频动作基础模型,用于实施。四个核心设计原则展示了其从 LingBot-VA 的演变。 (1) 与传统的以重建为重点的 VAE 不同,我们引入了语义视觉动作标记器,它将视觉表示与语义和动作结合起来,提高后续策略学习中的指令遵循和动作精度。 (2)考虑到时间动态的严格因果性质,我们采用因果预训练范式,从头开始训练,以避免在适应双向架构时经常发生的灾难性遗忘。 (3) 为了满足高频推理的需求,我们的模型采用稀疏 MoE 主干,在不影响效率的情况下扩展模型容量。 (4) 通过增强的异步推理方案实现实时闭环控制,该方案与动作执行并行地预测未来潜在状态,同时通过学习的前向动力学将每次轨迹展开重新基于最新的观察。现实世界的部署验证了 LingBot-VA 2.0 作为一个强大的基础模型,其跨复杂操作任务的几次泛化就证明了这一点。