论文

ExploreVLA:端到端自动驾驶的密集世界建模和探索

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

模型训练强化学习

摘要

基于视觉-语言-动作(VLA)架构的端到端自动驾驶模型通过专家演示的行为克隆来学习驾驶策略,显示出了可喜的结果。然而,模仿学习本质上限制了模型复制观察到的行为,而不探索不同的驾驶策略,使其在新颖或分布外的场景中变得脆弱。强化学习 (RL) 提供了一种自然疗法,可以实现专家分布之外的政策探索。然而,VLA 模型通常在离线数据集上进行训练,缺乏直接可观察的状态转换,因此需要一个学习的世界模型来预测行动后果。在这项工作中,我们提出了一个统一的理解和生成框架,利用世界建模来同时实现有意义的探索并提供密集的监督。具体来说,我们通过未来的 RGB 和深度图像生成作为密集世界建模目标来增强轨迹预测,要求模型学习细粒度的视觉和几何表示,从而大大丰富规划主干。除了充当监督信号之外,世界模型还充当政策探索的内在奖励来源:其图像预测不确定性自然地衡量了轨迹相对于训练分布的新颖性,其中高度不确定性表明分布外场景,如果安全,则代表有价值的学习机会。我们将这种探索信号纳入安全门控奖励中,并通过组相对策略优化(GRPO)来优化策略。 NAVSIM 和 nuScenes 基准测试的实验证明了我们方法的有效性,在 NAVSIM 上实现了最先进的 PDMS 分数 93.7 和 EPDMS 88.8。代码可在 https://zihaosheng.github.io/ExploreVLA/ 获取。