论文
H-JEPA:端到端视觉规划分层世界模型的学习
H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
摘要
使用潜在世界模型进行长期规划需要跨时间尺度和抽象级别进行推理。现有的与任务无关的 JEPA 世界模型在单个时间尺度或在一个共享的潜空间中进行多个时间范围的预测和计划。我们引入了 H-JEPA,这是训练的端到端配方,这是一个动作条件 JEPA 的层次结构,其中每个级别都在其自己学习的潜空间中预测更远的未来。规划自上而下进行:顶层优化实现目标的进度,每个级别的预测都成为其下级规划者的子目标。当数据中的因素在不同的时间尺度上演变时,更高级别会丢弃快速、不可预测的细节,并保留较慢的任务相关状态。在四个模拟导航和操作环境中,分层规划比平面 JEPA 有所改进;在 Visual AntMaze 上,三级层次结构使用更少的规划器计算将成功率从 18% 提高到 73%。 消融将这些收益归因于时间分解和更高级别的目标表示。通过逆动态监督,该方法扩展到 DROID 的各种真实机器人视频,其中层次结构提高了较低规划器计算的离线规划保真度。
