论文
VPP2:改进视频预测以提升机器人动作泛化
Video Prediction Policy 2: Predict Better, Act Better
摘要
世界动作模型(WAM)已成为一类重要的通用机器人策略,旨在将视频预测转移到动作学习之前。然而,我们发现现有的 WAM 在开放环境中经常产生不正确的运动预测,从而导致错误的动作。我们将此限制归因于两个因素:(1)基础视频模型未针对操作进行优化,(2)天真地将动作组件合并到视频模型中可能会大大降低其泛化能力。我们引入了视频预测策略 2 (VPP2),这是一种 WAM,可在视频预测和动作生成中实现强大的零样本泛化。首先,我们策划一个大规模、多样化的操作视频数据集,以继续预训练基本视频基础模型。我们用详细的字幕注释视频剪辑,并执行 \textit{event-level} 视频预训练,以促进开放式操作任务的泛化。其次,我们对视频模型进行后训练并将其提炼为具有固定预测范围的单步视觉规划器。最后,我们介绍一下 动作模块通过混合Transformer(MoT)架构来学习隐式逆动力学模型。实验证明了三个关键结果:(1)在开放式任务中,VPP2-14B 在视频预测指令跟踪成功率方面比 Cosmos3-64B 提高了 11.0%; (2) VPP2 在现实世界零样本 ALOHA 操作任务上的成功率超过最强基线 18.5%; (3) 经过特定基准的后训练,VPP2 在具有挑战性的 LIBERO-Pro、LIBERO-OOD 和 RoboDojo 基准的评估方法中取得了最高的成功率。
