论文

WALT:从冻结驾驶世界模型学习轨迹潜空间

WALT: Learning World-Model-Aligned Latent Trajectories for Autonomous Driving

摘要

驾驶世界模型从视觉观察中学习周围环境的丰富预测表示,但准确的视觉预测并不一定转化为有效的轨迹规划。我们认为,一个关键瓶颈在于视觉世界状态和原始几何轨迹之间的不匹配,这可能会限制规划者利用世界模型编码的与动作相关的语义的能力。为了解决这个问题,我们提出了潜在轨迹的世界模型对齐(WALT),它通过从冻结的预训练驾驶世界模型传输信息来学习紧凑的生成轨迹潜在空间,而无需修改世界模型本身。 WALT 不是直接生成原始路径点,而是通过双分支轨迹自动编码器将它们映射为紧凑的表示,并将语义知识从冻结的视觉世界模型传输到该轨迹空间,鼓励学习的动作表示捕获与未来运动和规划相关的场景级线索。除了我们提出的公式之外,我们还系统地研究基于联合嵌入预测架构(JEPA)的潜在学习和遵循表示对齐(REPA)的特征对齐,以研究仅轨迹表示学习如何影响下游规划。我们根据 NAVSIM 基准评估 WALT。相对于原始航路点基线,WALT 将 NAVSIMv1 上的 PDMS 从 89.4 提高到 89.8,将 NAVSIMv2 上的 EPDMS 从 87.3 提高到 87.9,同时将轨迹规划器 FLOP 减少 30.5%。这些结果表明,在提取与动作相关的信息的同时保留世界表示,为基于世界模型的轨迹规划提供了有效的接口。

WALT先训练双分支轨迹自编码器,再将紧凑轨迹表示用于驾驶规划。
图2(图注摘要):WALT先训练双分支轨迹自编码器,再将紧凑轨迹表示用于驾驶规划。