论文
DriveWAM:视频生成先验为自动驾驶实现可扩展的世界动作建模
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
摘要
预训练的基础模型已成为端到端自动驾驶的重要基础。与主要在静态图像文本对上预训练的视觉语言模型相比,视频生成模型捕获自然适合驾驶的时间动态和运动先验。我们提出了 DriveWAM,一种驾驶世界动作模型,它将预训练的视频扩散 Transformer 改编为自回归视频动作策略。 DriveWAM 将视频和动作流组织成统一的时间词元序列,并在联合流匹配目标下对其进行训练,保留预训练的视频生成架构,同时将其大规模视频先验以适应动作生成。为了整合高级场景理解,我们引入了场景演化驾驶指导,其中冻结的 VLM 产生特定于块的语义意图来指导视频动作生成。为了保持长期轨迹采样有界,我们进一步引入选择性 KV 内存,它通过推理时的相关冗余缓存选择来维护有界模态感知视频和动作内存池。 NAVSIM 和 PhysicalAI-Autonomous-Vehicles 基准测试表明,DriveWAM 实现了强大的规划性能,并且从 4k 到 100k 驾驶片段的数据扩展研究进一步证实了端到端自动驾驶的世界动作建模的扩展潜力。