论文
Cosmos Policy:为视觉运动控制与规划微调视频模型
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
摘要
近期的视频生成模型展现出捕捉复杂物理交互与场景随时间演化的卓越能力。为利用其时空先验,机器人工作已把视频模型改造用于策略学习,但通过需要多阶段后训练与用于动作生成的新架构组件而引入复杂性。在本工作中,我们提出 Cosmos Policy,一种简单方法:通过在目标平台上采集的机器人演示数据上进行单阶段后训练,把大型预训练视频模型(Cosmos-Predict2)改造为有效的机器人策略,无需架构修改。Cosmos Policy 学会直接生成被编码为视频模型潜扩散过程中潜在帧的机器人动作,利用模型预训练先验与核心学习算法捕捉复杂动作分布。此外,Cosmos Policy 生成未来状态图像与价值(期望累积回报),它们同样被编码为潜在帧,支持对具有更高成功可能性的动作轨迹进行测试时规划。在我们的评估中,Cosmos Policy 在 LIBERO 与 RoboCasa 仿真基准上取得最先进性能(平均成功率分别为 98.5% 与 67.1%),并在具有挑战性的真实世界双手操作任务上取得最高平均分,优于从零训练的强扩散策略、基于视频模型的策略以及在相同机器人演示上微调的最先进视觉-语言-动作模型。此外,给定策略 rollout 数据,Cosmos Policy 能从经验中学习以精炼其世界模型与价值函数,并利用基于模型的规划在挑战性任务上取得更高成功率。我们在 https://research.nvidia.com/labs/dir/cosmos-policy/ 发布代码、模型与训练数据。
