论文

SV-WAM:用于端到端自动驾驶的高效环视世界动作模型

SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving

模型架构Transformer

摘要

世界模型(WM)通过学习未来场景动态的预测表示,展示了端到端自动驾驶的强大潜力。然而,在推理过程中生成未来视频会带来大量的计算开销,导致许多最近的驾驶 WM 采用单个前置摄像头作为高效部署的输入。这种设计限制了变道、并道和转弯等安全关键操作的空间覆盖范围。为了解决这一限制,我们提出了 SV-WAM,这是一种环视世界动作模型 (WAM),它可以保留完整的六摄像头观察结果,同时保持高效的推理。 SV-WAM 利用未来视频预测作为共享生成模型中动作学习的密集训练监督,而不是作为推理时间输出。该设计的核心是一个以动作为中心的因果掩码,可防止动作词元在联合动作视频去噪期间参与未来视频词元。因此,视频分支可以在部署时被丢弃,从而实现高效的仅行动规划。此外,我们引入了可微分的可行驶区域合规性正则化器,可以惩罚接近或跨越可行驶边界的车辆足迹角,从而提高规划安全性和边界意识。对闭环 NAVSIMv2 基准和开环 nuScenes 基准的大量实验表明,SV-WAM 实现了最先进的规划性能、低推理延迟和具有竞争力的零样本传输能力。