论文
深度正则化 JEPA 世界模型从真实户外机器人数据中了解更多可转移表示
Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data
摘要
世界模型,尤其是基于 JEPA 架构的世界模型,已被证明可以学习各种环境的稳健动态。然而,从视觉上复杂的现实世界数据中学习仍然是一个挑战,特别是在不可预测的户外环境中。我们在训练期间引入深度作为几何先验,直接从机器人视频数据学习更强大的潜在动态并处理视觉复杂性。这将深度监督与各向同性诱导潜在正则化器(SIGReg)相结合,最大化与任务无关的潜在多样性,同时限制多样性的组织方式,并且组合目标针对与场景几何一致的最高熵表示。为了在不增加推理时间的情况下满足这种更大的复杂性,我们还添加了仅训练的过度参数化。我们利用来自真实农业机器人的视频训练 18M 参数模型,并使用冻结表示视觉里程计探针、基于预测器的意外检测和多步潜在预测轨迹保真度进行评估。与基线 LeWM 相比,我们的方法将视觉里程计探测误差降低了 33%,大大增加了域内和域外 TartanGround 基准的意外分数分离,并提高了域转移下的多步预测轨迹保真度,增益随着预测轨迹范围的增加而增长。值得注意的是,我们还看到了与 3D 几何形状(例如光照和阴影)不直接相关的物理理解的意外得分分离的改进。这些结果表明,轻量级训练时几何先验使得紧凑的 JEPA 世界模型在具有强大底层表示的真实户外数据上更有用且更可转移,而无需增加推理开销。我们的工作表明,深度作为物理基础的先验可以增强各种任务的世界模型泛化能力。