论文

ThinkDrive:面向自动驾驶的思维链引导渐进式强化学习微调

ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving

模型训练强化学习

摘要

随着大语言模型(LLM)技术的快速进步,其在自动驾驶领域的应用日益广泛。然而,现有方法存在推理非结构化、泛化能力差以及与人类驾驶意图不对齐等问题。思维链(CoT)推理虽然提升了决策透明度,但常规监督微调(SFT)未能充分发挥其潜力,而强化学习(RL)方法则面临不稳定与推理深度欠佳的问题。我们提出 ThinkDrive,一个面向自动驾驶的 CoT 引导渐进式强化学习微调框架,将显式推理与难度感知的自适应策略优化相结合。我们的方法采用两阶段训练策略:首先使用 CoT 解释进行 SFT;随后应用渐进式强化学习,采用难度感知的自适应策略优化器,根据样本复杂度动态调整学习强度。我们在公开数据集上评估了该方法。结果表明,ThinkDrive 在 exam、easy-exam 和 accuracy 上分别超出强 RL 基线 1.45%、1.95% 和 1.01%。此外,用我们方法训练的 2B 参数模型在 exam 指标上超过大得多的 GPT-4o 3.28%。

ThinkDrive:面向自动驾驶的思维链引导渐进式强化学习微调 配图
图 2:面向自动驾驶的 ThinkDrive 框架概览。输入包括一张驾驶场景图像、当前待处理的查询以及任务指令。模型的推理能力通过两阶段训练策略得到增强,其中最关键的组成部分是由基于高斯的课程采样与难度感知的自适应策略优化机制构成的渐进式 RL 方法。