论文
DriveDreamer-Policy:用于统一生成和规划的基于几何的世界动作模型
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
摘要
最近,世界动作模型(WAM)的出现连接了视觉-语言-动作(VLA)模型和世界模型,统一了它们的推理和指令跟踪能力以及时空世界建模。然而,现有的 WAM 方法通常侧重于对 2D 外观或潜在表示进行建模,几何基础有限——这是在物理世界中运行的具身系统的基本要素。我们推出了 DriveDreamer-Policy,这是一个统一的驾驶世界动作模型,它将深度生成、未来视频生成和运动规划集成在单个模块化架构中。该模型采用 大语言模型 来处理语言指令、多视图图像和动作,然后是三个轻量级生成器,用于生成深度、未来视频和动作。通过学习几何感知的世界表示并用它来指导统一框架内的未来预测和规划,所提出的模型可以产生更连贯的想象未来和更明智的驾驶行为,同时保持模块化和可控延迟。 Navsim v1 和 v2 基准测试的实验表明,DriveDreamer-Policy 在闭环规划和世界生成任务上均实现了强大的性能。特别是,我们的模型在 Navsim v1 上达到 89.2 PDMS,在 Navsim v2 上达到 88.7 EPDMS,优于现有的基于世界模型的方法,同时产生更高质量的未来视频和深度预测。消融研究进一步表明,显式深度学习为视频想象力提供了补充优势,并提高了规划的稳健性。