论文

D-JEPA:决策一致的潜在世界模型

D-JEPA: A Decision-Aligned Latent World Model

模型训练偏好优化

摘要

潜在世界模型预测行动的后果,但准确的预测并不能保证潜在距离反映哪个候选者将成功执行。我们发现了决策局部预测差距:在少数竞争执行的未来中,预测更接近目标的候选者可能会产生比可用替代方案更糟糕的实现结果。我们引入了 D-JEPA,一种决策一致的潜在世界模型,可以从执行的结果中学习候选未来之间的决策相关关系。有界的排列等变算子联合对目标相关的预测特征和序数证据进行推理,细化行动选择最重要的预训练预测几何。受限的预测变量适应和共享序数接口将这种对齐扩展到互补的预测几何结构。 D-JEPA 进一步在 JEPA 兼容的未来表示中实现了学习的决策结构,从而能够通过本机潜在距离规划进行部署。对潜在控制、操纵、预训练动作生成模型、物理机器人和自动驾驶的评估表明,动作选择得到了改进,包括 PushT 的成功率为 87.89%,RoboTwin 的平均增益为 15.04 点,物理机器人任务的增益为 17 点。这些结果建立了与决策相关的关系结构,作为预测世界建模和有效控制之间的直接桥梁。