论文

潜在世界模型的规划限制

The Planning Limits of Latent World Models

模型评测模型能力评测

摘要

世界模型提供了一种有前途的方法来帮助机器人了解物理世界如何演变并通过想象力规划复杂的行为。然而现有的研究主要证明了这些模型可以实现什么,但不清楚它们的预测何时对规划有用以及它们在哪里失败。我们使用基于五个冻结的自我监督视觉主干的动作条件预测器来研究这个问题:V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2。我们使用冻结主干来测试旨在跨环境传输的表示。我们在各种元世界操作任务和 BridgeData V2 的真实机器人交互上评估这些模型。我们发现,只有当目标位于或稍微超出它在规划过程中想象的轨迹时,世界模型才能可靠地指导行动选择。通过五步rollout(即预测器训练的长度),世界模型仅对领先 5 到 10 个控制步骤的目标可靠地排名操作,而任务目标则位于 16 到 53 步之外。 81 倍大的预测器和更长的rollout训练都没有扩展这个范围;编码器会影响范围和闭环成功,其中 V-JEPA 2.1 的表现最为一致。更根本的是,在完美的预测下,限制仍然存在:使用真实的模拟器,当目标从五步rollout前五步移动到二十步时,成功率从 92% 下降到 41%。因此,规划要么需要更长的想象轨迹,要么需要更接近的子目标。对于遥远的目标,纯粹的想象力在 23% 的情节中成功,带反馈的规划 (MPC) 将成功率提高到 30%,想象远方的目标达到 47%,附近的专家子目标达到 76%。在其可规划范围内使用世界模型还可以改进视觉-语言-行动 (VLA) 策略:在 VLA 提出的八个行动中进行选择,可以将 16 个不同任务的成功率从 65% 提高到 77%。