论文

放大:用于运动规划的多模态 大语言模型 的 RL 微调

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 在语义理解和常识推理方面表现出了卓越的能力,使其成为解决自动驾驶规划问题的有希望的候选者。然而,MLLM 的 预训练 和监督 微调 (SFT) 中传统使用的下一个词元文本预测目标可能无法实现自动驾驶汽车的规划目标。下一个词元预测目标仅鼓励文本中的每个词元模仿,通常不考虑多步骤后果以及与关键规划考虑因素(例如为其他道路参与者提供空间)的一致性。为了克服这些限制,我们提出了一种强化学习 微调 (RLFT) 方法,即 MAGNIFIED,该方法通过学习 词元级 奖励,使基于 MLLM 的驾驶代理与规划目标保持一致。通过将一系列预测标记映射到相应的车辆轨迹并从规划奖励中学习,MAGNIFIED 针对真正的规划目标进行了优化,而不是仅仅关注标记预测的准确性,使模型能够完善对规划任务的理解,而不仅仅是简单的模仿。我们在 Waymo 开放运动数据集上验证了我们的方法,采用了一种新颖的设置,将光栅化鸟瞰图和标记化轨迹作为输入和面向规划的输出。初始 SFT 阶段在以文本中的 X-Y 坐标序列输出计划轨迹方面建立了强大的基线,而随后的 RL 微调 相对于 SFT 基线大大提高了规划性能(展示了重叠率降低了 10.5%,越野率降低了 38.9%),强调了 MLLM 上的 RLFT 实现车辆规划的潜力,该车辆规划更好地符合合规性、舒适性和高效性驾驶。