论文

DriveZero:超越人类演示的端到端驾驶

DriveZero: End-to-End Driving Beyond Human Demonstrations

模型训练强化学习

摘要

大多数端到端自动驾驶系统通过模仿人类驾驶日志来学习,其学习行为受到记录轨迹的质量和行为覆盖范围的限制。本报告介绍了 DriveZero,这是一个端到端系统,可以学习超越人类演示的驾驶行为。它将驾驶分解为感知模型和行动模型,在最适合它的体系中对每个模型进行预训练,并将它们组合成一个端到端规划器。这两种模型需要不同的学习秘诀:感知必须了解世界,并受益于海量且多样化的视觉数据;行动必须与之互动,并且需要闭环反馈。在行动方面,我们引入了 DriveRL,一种混合​​智能体闭环强化学习框架。它将真实的驾驶日志转换为交互式世界,其中通过闭环部署使用 PPO 来训练特权教师策略。对于感知模型,DriveVFM 将多个冻结视觉基础模型(包括 DINOv3、SigLIP2、SAM 和 Depth Anything V2)整合为仅来自原始图像的单个主干,无需特定于任务的注释。然后,DriveZero 将两者结合起来:一个仅使用相机的规划器,通过其采样的轨迹蒸馏冻结的 DriveRL 教师。此外,可以在增强的驾驶意图下询问以目标为条件的教师,从而产生记录数据无法提供的多样化、目标一致的监督。在 nuPlan 上,具有价值引导测试时动作搜索的 DriveRL 在非反应性和反应性模式下的 Val14、Test14-hard 和 Test14-random 社区划分中取得了 93.57 的平均分数,在所有三个划分上都超过了 Log-Replay 专家。 DriveZero 在 NAVSIMv1、NAVSIMv2 和闭环 HUGSIM 基准上实现了最先进的性能,无需任何人类轨迹监督。