论文
有时你必须先跑后走:VLM自动驾驶先跑后走的调度策略
Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving
摘要
最近基于 VLM 的自动驾驶规划器采用 GRPO 式强化学习来优化驾驶性能。然而,现有的GRPO方案要么优化驾驶效率,冒着追求进步但不安全行为的风险,要么强制实施早期安全约束,导致过于保守的行为;两者都需要长期的训练。为了解决这些问题,我们首先揭示了两种不同的强化学习机制:积极探索高进度的进度机制(Run-GRPO)和在稳定进度下恢复安全的安全机制(Walk-GRPO)。基于这一发现,我们提出了 $\textit{Run-then-Walk}$,一种简单而有效的 GRPO 两阶段奖励调度策略,实现了更好的性能和更快的收敛。与单阶段强化学习不同,单阶段强化学习可能在单个训练阶段关注进度、安全或两者的混合,而该时间表明确地将进度发现与安全修复分开。在$\textit{Run}$阶段,我们关注进展,让政策摆脱保守偏见并发现高进展模式。在随后的 $\textit{Walk}$ 阶段,我们引入端点和安全策略来修复 Run 阶段的不安全行为。这种反向调度克服了步行优先方法的保守性和联合优化的不安全的进度寻求。我们使用各种基于 VLM 的规划器在多个基准上对其进行验证:NAVSIMv1、NAVSIMv2、Navhard 和 nuScenes。大量实验表明,驾驶性能得到改善,同时所需的 RL 训练次数比基线少 40--50%。