论文
DriveVA:视频动作模型是零镜头驱动程序
DriveVA: Video Action Models are Zero-Shot Drivers
摘要
泛化是自动驾驶的一个核心挑战,因为现实世界的部署需要在未见过的场景、传感器域和环境条件下具有强大的性能。最近基于世界模型的规划方法在场景理解和多模式未来预测方面表现出了强大的能力,但它们跨数据集和传感器配置的泛化仍然有限。此外,它们松散耦合的规划范式通常会导致视觉想象过程中视频轨迹一致性较差。为了克服这些限制,我们提出了 DriveVA,这是一种新颖的自动驾驶世界模型,可以在共享的潜在生成过程中联合解码未来的视觉预测和动作序列。 DriveVA 从经过良好预训练的大规模视频生成模型继承了关于运动动力学和物理合理性的丰富先验,以捕获连续的时空演化和因果交互模式。为此,DriveVA 采用基于 DiT 的解码器来联合预测未来的动作序列(轨迹)和视频,从而实现规划和场景演进之间更紧密的结合。我们还引入了视频延续策略来加强长程生成轨迹的一致性。 DriveVA 基于 PDM 的规划性能在 NAVSIM 基准上取得了 90.9 分的 PDM 分数,令人印象深刻。大量实验还证明了 DriveVA 的零射击能力和跨域泛化能力,与最先进的基于世界模型的规划器相比,在 nuScenes 上平均 L2 错误和碰撞率降低了 78.9% 和 83.3%,在基于 CARLA v2 的 Bench2Drive 上降低了 52.5% 和 52.4%。