论文

Latent-WAM:端到端自动驾驶的潜在世界动作建模

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

摘要

我们引入 Latent-WAM,这是一种高效的端到端自动驾驶框架,可通过空间感知和动态信息的潜在世界表示实现强大的轨迹规划。现有的基于世界模型的规划器受到压缩表示不充分、空间理解有限和时间动态利用不足的困扰,导致在数据和计算预算受限的情况下规划不理想。 Latent-WAM 通过两个核心模块解决了这些限制:空间感知压缩世界编码器 (SCWE),它从基础模型中提取几何知识,并通过可学习查询将多视图图像压缩为紧凑的场景标记;动态潜在世界模型 (DLWM),它采用因果 Transformer,根据历史视觉和运动表示自动回归预测未来世界状态。 NAVSIM v2 和 HUGSIM 上的大量实验展示了新的最先进结果:NAVSIM v2 上的 EPDMS 为 89.3,HUGSIM 上的 HD 分数为 28.9,以 3.2 EPDMS 超越了最佳先验无感​​知方法,并且训练数据显着减少,并且具有紧凑的 104M 参数模型。