论文

FactorDrive:由端到端自动驾驶规划关键因素驱动的自适应多步骤推理

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

模型训练强化学习

摘要

视觉语言模型 (VLM) 具有先进的场景理解能力,并可在端到端自动驾驶中实现显式推理。然而,现有方法未充分将空间物理证据整合到规划推理中,推理适应仍然是粗粒度的,无法满足特定场景的规划需求。此外,在自动驾驶 后训练 中,用于提高规划质量的推理路径优化在很大程度上仍未得到探索。为了解决这些限制,我们提出了 FactorDrive,这是一种端到端自动驾驶框架,用于由规划关键因素(PCF)驱动的自适应多步骤推理。我们首先进行大规模驾驶领域指令调整以建立基础驾驶知识。在此基础上,我们构建了 PCF-CoT,这是一个思想链(CoT)数据集,它将规划推理基于与轨迹相关的空间物理证据,并围绕特定场景的 PCF 组织推理,使推理路径的组成和深度能够适应不同的规划需求。我们进一步引入质量搜索引导的组相对策略优化(QS-GRPO),它以轨迹级规划奖励指导蒙特卡罗树搜索(MCTS)发现具有更高规划质量的推理路径,并使用得到的响应通过GRPO优化策略,从而提高轨迹规划性能。对开环 (nuScenes) 和面向闭环 (NAVSIM) 基准的大量实验表明,FactorDrive 实现了最先进的规划性能。