论文

Found-RL:面向自动驾驶的基础模型增强强化学习

Found-RL: foundation model-enhanced reinforcement learning for autonomous driving

摘要

强化学习(Reinforcement Learning,RL)已成为端到端自动驾驶(Autonomous Driving,AD)的主导范式。然而,RL 存在样本效率低下以及在复杂场景中缺乏语义可解释性的问题。基础模型,尤其是视觉语言模型(Vision-Language Model,VLM),能够通过提供丰富的、情境感知的知识来缓解这一问题,但其高推理延迟阻碍了在高频 RL 训练回路中的部署。为弥合这一差距,我们提出 Found-RL,一个旨在利用基础模型高效增强自动驾驶 RL 的平台。一项核心创新是异步批量推理框架,它将繁重的 VLM 推理与仿真回路解耦,有效解决延迟瓶颈以支持实时学习。我们引入多样的监督机制:值间隔正则化(Value-Margin Regularization,VMR)与优势加权动作引导(Advantage-Weighted Action Guidance,AWAG),以有效地将类专家的 VLM 动作建议蒸馏进 RL 策略。此外,我们采用高吞吐量的 CLIP 进行密集奖励塑形。我们通过条件对比动作对齐(Conditional Contrastive Action Alignment)解决 CLIP 的动态盲区问题,该方法将提示条件化于离散化的速度/指令,并从情境特定的动作锚点评分中产生归一化的、基于间隔的奖励加成。Found-RL 提供了一个用于集成微调后 VLM 的端到端流水线,并表明轻量级 RL 模型与十亿参数级 VLM 相比可以达到接近 VLM 的性能,同时保持实时推理(约 500 FPS)。代码、数据和模型将公开发布于 https://github.com/ys-qu/found-rl。