论文
SimWAM:端到端自动驾驶的简单世界行动模型
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
摘要
在自动驾驶中,世界动作模型(WAM)通过在动作预测之前传输视频动态来改进端到端规划,但许多模型仍然在推理时将规划与未来视频生成结合起来,从而产生大量的计算开销。我们推出了 SimWAM,这是一种简单而有效的 WAM,它仅利用未来视频预测作为训练时的监督信号。它通过联合流匹配来共同训练预训练的视频专家和轻量级动作专家。孤立的注意掩模使动作预测独立于未来帧,从而允许在推理时无需生成未来帧的轨迹预测。该设计支持多个预训练视频主干和共享注意力界面内的独立动作专家缩放,同时保留联合学习目标。此外,我们应用强化学习来优化轨迹模仿之外的组合驾驶奖励。实验表明,SimWAM 在 NAVSIM 上实现了 91.9 美元的 PDMS,在基于世界模型的规划器之间实现了准确性和延迟之间的有利权衡,同时将零样本转移到 nuScenes。它还在 WOD-E2E 和物理人工智能自动驾驶车辆上实现了具有竞争力的规划准确性。这些结果使 SimWAM 成为高效自动驾驶的简单而可靠的基准。代码和模型权重可在 https://github.com/H-EmbodVis/SimWAM/ 获取。