论文
WorldLine:机器人操作的动作驱动视觉模拟
WorldLine: Action-Driven Visual Simulation for Robotic Manipulation
摘要
现实世界的机器人学习受到收集经验和评估候选行为的成本的限制。视频生成模型为视觉模拟器提供了可扩展的基础,可以在实际执行之前预测动作结果。然而,他们通常更喜欢视觉合理性,而不是准确的动作跟踪和连贯的机器人-物体动力学,而动作条件模拟器依赖于稀缺的、特定于实施例的数据,这些数据很难在不兼容的控制空间中共享。我们rollout了 WorldLine,一种动作驱动的视觉模拟器,它将可迁移的动态学习与异构动作基础分离。 WorldLine 从超过 10,000 小时的无动作机器人视频中学习操作动态,并使用 10 多个实施例中超过 2,000 小时的动作轨迹来为它们奠定基础。图像空间动作表示提供跨实施例的共享控制接口,而具有关系正则化的多视图和故障丰富训练改进了交互敏感预测。以机器人为中心的几步蒸馏可以实现高效的因果rollout,同时保留关键动作运动。在保留和域外设置中,WorldLine 保持了强大的视觉质量和机器人运动一致性;在失败的轨迹上,它比最强基线提高了 0.1626 的机器人掩模 IoU。它对 RoboTwin 和 AgiBot 的轨迹成功预测平均准确率为 74%,比最强基线高出 1 个百分点。在没有 RoboTwin 训练或适应的情况下,其rollout将任务成功率比直接策略执行提高了 21.4 个百分点。这些功能共同使 WorldLine 成为用于政策评估和具体规划的可扩展且高效的视觉模拟器。更多结果请参见\href{https://zhengsh123.github.io/WorldLine/}{project page}。