论文

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

模型训练强化学习

摘要

端到端自动驾驶(E2E-AD)旨在将原始传感器信息直接映射到驾驶行为。最近,随着多模态 大语言模型(MLLM)的快速发展,研究人员提出了 E2E-AD 的视觉-语言-动作(VLA)模型范式,旨在将视觉感知、语言理解和动作预测集成到单个策略中。然而,现有的基于 VLA 的策略主要采用模仿学习,仅通过优化基于距离的指标来学习驾驶。记录专家轨迹。开环训练和闭环推理之间的这种分布转变会导致闭环规划的性能不佳。为了弥补这一差距,我们推出了 CLEAR,这是一个能够使用强化学习 (RL) 进行大规模 E2E-AD 闭环训练的系统。我们建议先从预训练的 VLA 策略中学习一种围绕路径点的新型剩余路径点策略,从而有效地利用其中的知识。另一方面,扩大强化学习以实现基于视觉的政策的关键挑战之一是并行模拟环境的数量,因为强化学习需要数据。为此,我们设计了一个异构管道,将模拟器和 VLA 学习器放置在不同的计算组上,这使我们能够大幅增加并行运行的模拟环境的数量,同时避免资源争用并保持训练稳定性。我们证明,通过简单的奖励,CLEAR 显着优于以前的方法,并在 CARLAlongest6 v2 和 Bench2Drive 的挑战性基准上设置了新的最先进的性能。