论文
WA-JEPA:重新思考自动驾驶世界动作建模的视频 JEPA 范式
WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving
摘要
视频联合嵌入预测架构(V-JEPA)通过自监督的潜在特征预测从视频中学习强大的时空表示。然而,V-JEPA 是围绕随机掩模完成和确定性回归构建的,这使得它从根本上不适合自动驾驶规划,因为自动驾驶规划需要面向未来的预测与行动紧密结合。为了解决这个问题,我们重新思考 V-JEPA 范例并提出 WA-JEPA,这是一种专为自动驾驶规划而设计的 V-JEPA 原生世界行动模型。 WA-JEPA 采用混合未来屏蔽 预训练,而不是随机时空屏蔽,其中模型从观察到的上下文推断未来潜伏。与确定性回归不同,我们将未来预测重新定义为潜在未来的条件流匹配,这大大提高了模型为下游规划生成合理的未来潜在的能力。最后,提出了一种联合的未来动作预测器,可以在统一的时空潜在空间中对未来场景标记和自我轨迹进行去噪,从而允许动作监督直接塑造与规划相关的世界表示。在 nuPlan 视频上进行预训练并在 NAVSIM 上进行微调后,WA-JEPA 在 NAVSIM-v2 上达到 91.7 EPDMS,超出最强的端到端和世界动作基线 1.6 和 1.3 EPDMS,并且在没有 HUGSIM 特定的 微调 的情况下,在相同条件下的闭环 HUGSIM 基准上获得 0.4462 的最佳 HD 分数评估协议。这些结果验证了 V-JEPA 原生世界动作建模作为自动驾驶规划的强大且可扩展的范例。代码可在 https://github.com/AFARI-Research/WA-JEPA 获取。