论文

学习自动驾驶的视觉-语言-动作世界模型

Learning Vision-Language-Action World Models for Autonomous Driving

应用与实践行业应用

摘要

视觉-语言-动作(VLA)模型最近通过将感知、推理和控制集成到统一的多模态框架中,在端到端自动驾驶方面取得了显着进展。然而,它们通常缺乏时间动态和全球世界一致性的明确建模,这限制了它们的预见性和安全性。相比之下,世界模型可以模拟合理的未来场景,但通常很难推理或评估它们生成的想象的未来。在这项工作中,我们提出了 VLA-World,这是一种简单而有效的 VLA 世界模型,它将预测性想象力与反思性推理相结合,以提高驾驶远见。 VLA-World 首先使用源自动作的可行轨迹来指导下一帧图像的生成,捕获描述周围环境如何演变的丰富的空间和时间线索。然后,该模型对这个自行生成的未来想象框架进行推理,以细化预测轨迹,从而实现更高的性能和更好的可解释性。为了支持这个管道,我们策划了 nuScenes-GR-20K,这是一个源自 nuScenes 的生成推理数据集,并采用了三阶段训练策略,包括预训练、监督 微调 和强化学习。大量实验表明,VLA-World 在规划和下一代基准方面始终超越最先进的 VLA 和世界模型基准。项目页面:https://vlaworld.github.io