论文
Uni-World VLA:自动驾驶的交错世界建模和规划
Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
摘要
自动驾驶需要推理环境如何演变并相应地规划行动。现有的基于世界模型的方法通常首先预测未来场景,然后进行规划,从而导致可能偏离实际决策过程的开环想象。在本文中,我们提出了 Uni-World VLA,这是一种统一的视觉-语言-动作(VLA)模型,它将未来帧预测和轨迹规划紧密地交织在一起。我们的模型不是在规划之前生成全面的世界展示,而是逐步在预测未来框架和自我行为之间交替,从而使规划决策能够不断地以想象的未来观察为条件。这种交错的生成形成了世界建模和控制之间的闭环交互,从而在动态交通场景中实现更具适应性的决策。此外,我们将单眼深度信息合并到帧中,为世界建模提供更强的几何线索,从而改进长视野场景预测。 NAVSIM 基准测试表明,我们的方法实现了有竞争力的闭环规划性能,同时产生高保真度的未来帧预测。这些结果表明,紧密耦合的世界预测和规划是可扩展 VLA 驱动系统的一个有前途的方向。