论文

$AutoDrive\text{-}P^3$:通过强化实现感知-预测-规划思想的统一链 微调

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

模型训练强化学习

摘要

视觉语言模型(VLM)由于其在处理长尾场景方面的卓越性能,越来越多地被应用于端到端自动驾驶系统。然而,当前基于VLM的方法存在两个主要局限性:1)一些VLM直接输出规划结果,没有思想链(CoT)推理,绕过了关键的感知和预测阶段,这造成了显着的领域差距并损害了决策能力; 2)其他VLM可以生成感知、预测和规划任务的输出,但采用碎片化的决策方法,这些模块单独运行,导致严重缺乏协同作用,从而损害了真正的规划绩效。为了解决这些限制,我们提出了 ${AutoDrive\text{-}P^3}$,这是一种新颖的框架,通过结构化推理无缝集成 $\textbf{P}$erception、$\textbf{P}$rediction 和 $\textbf{P}$lanning。我们引入 ${P^3\text{-}CoT}$ 数据集来促进连贯推理,并提出 ${P^3\text{-}GRPO}$,这是一种分层强化学习算法,可为所有三个任务提供渐进式监督。具体来说,${AutoDrive\text{-}P^3}$ 逐步生成用于感知、预测和规划的 CoT 推理和答案,其中感知为后续预测和规划提供重要信息,而感知和预测共同为最终的规划决策做出贡献,从而实现更安全、更可解释的自动驾驶。此外,为了平衡推理效率和性能,我们引入了双重思维模式:详细思维和快速思维。对开环 (nuScenes) 和闭环 (NAVSIMv1/v2) 基准的大量实验表明,我们的方法在规划任务中实现了最先进的性能。代码可在 https://github.com/haha-yuki-haha/AutoDrive-P3 获取。