论文
同策略 蒸馏 自动车辆运动规划语言模型
On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning
摘要
大语言模型 (LLM) 最近通过将轨迹预测重新表述为语言生成问题,展示了自主车辆运动规划的强大潜力。然而,在资源有限的机载系统中部署功能强大的 LLM 仍然是一项根本挑战。在本文中,我们研究如何有效地将运动规划知识从大型教师 LLM 转移到更小、更易于部署的学生模型。我们以 GPT-Driver 框架为基础,该框架将驾驶场景表示为语言提示,并通过思想链推理生成路点轨迹,并研究了两种学生训练范例:(i)同策略 广义 知识蒸馏(GKD),它使用来自教师的密集 词元级 反馈来训练学生自己生成的输出,以及(ii)密集反馈强化学习(RL) 基线,使用教师的对数概率作为策略梯度框架中每个词元的奖励信号。 nuScenes 基准测试表明,尽管模型大小减少了 5倍,但 GKD 的性能大大优于 RL 基线,并且接近教师水平的性能。这些结果凸显了 同策略 蒸馏 作为在自动驾驶系统中部署基于 LLM 的规划器的原则性且有效的方法的实用价值。