论文
提炼思考,预见行动:自动驾驶的认知物理强化学习
Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving
摘要
当前的端到端自动驾驶模型从根本上受到模仿学习行为克隆天花板的限制。虽然强化学习提供了一条通往更智能自主的道路,但它需要两个缺失的基础设施:(1)理解交通语义和驾驶意图的认知基础,以及(2)可以预测候选者行为后果的有远见的物理环境。为此,我们提出了CoPhy,一个用于自动驾驶的认知物理强化学习框架。为了提炼思考,我们将 VLM 知识提炼到 BEV 编码器中,然后完全丢弃 VLM,以零推理成本保留认知能力,同时将认知通道释放为可选人类语言命令的可插拔接口。为了预见行动,我们构建了一个自回归 BEV 世界模型,该模型明确预测以候选行动为条件的未来语义图,充当可解释的物理沙箱,从中直接导出安全指标。在此双重基础设施的基础上,我们通过 GRPO 和一种新颖的双重奖励机制优化驾驶策略:从 BEV 采样轨迹中获得的物理奖励强制执行严格的安全约束,而来自语言一致评分者的认知奖励则确保意图合规性。大量实验表明,CoPhy 不仅在 NAVSIM v1 和 v2 基准上取得了最先进的结果,而且还通过用户定义的语言指令实现认知场景合规性和灵活的意图控制,从而实现更安全的驾驶。