论文

H-JEPA:端到端视觉规划分层世界模型的学习

H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning

模型架构新型架构

摘要

使用潜在世界模型进行长期规划需要跨时间尺度和抽象级别进行推理。现有的与任务无关的 JEPA 世界模型在单个时间尺度或在一个共享的潜空间中进行多个时间范围的预测和计划。我们引入了 H-JEPA,这是训练的端到端配方,这是一个动作条件 JEPA 的层次结构,其中每个级别都在其自己学习的潜空间中预测更远的未来。规划自上而下进行:顶层优化实现目标的进度,每个级别的预测都成为其下级规划者的子目标。当数据中的因素在不同的时间尺度上演变时,更高级别会丢弃快速、不可预测的细节,并保留较慢的任务相关状态。在四个模拟导航和操作环境中,分层规划比平面 JEPA 有所改进;在 Visual AntMaze 上,三级层次结构使用更少的规划器计算将成功率从 18% 提高到 73%。 消融将这些收益归因于时间分解和更高级别的目标表示。通过逆动态监督,该方法扩展到 DROID 的各种真实机器人视频,其中层次结构提高了较低规划器计算的离线规划保真度。

H-JEPA:端到端视觉规划分层世界模型的学习的原论文方法或结果图
图 1:分层抽象支持多个时间尺度的规划。左:Visual AntMaze 中分层规划的可视化。 3级计划朝着最抽象的潜空间中的最终目标迈进。它的第一个预测状态成为 2 级规划器的子目标;这种分解递归到 1 级规划器,输出原始动作。第一列和最后一列分别解码每个级别的开始和目标潜变量;中间的列解码其计划的预测。更高级别的潜变量保留蚂蚁的位置和迷宫布局,同时丢失腿部姿势细节。正式规划程序请参见§2.2。右:AntMaze 上的规划成功与规划器计算。曲线显示平坦 LeWM [53] 和两级/三级 H-JEPA 的帕累托前沿;误差线是三对模型和规划器种子的标准误差 (SE) (§4.1)。