论文
结果导向的 蒸馏:推进自动驾驶中 VLM 推理的师生框架
Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving
摘要
端到端(E2E)自动驾驶旨在学习从视觉观察到控制动作的直接映射。然而,这些端到端模型通常充当黑匣子,难以应对复杂的场景。为了解决这个问题,最近的工作结合了视觉语言模型(VLM)来提供明确的推理,增强可解释性和驱动鲁棒性。这些方法通常依赖于预先生成的注释,这些注释可能存在标签缺陷,并且需要昂贵的人力。在这项工作中,我们提出了一个新的框架,通过师生架构集成了结构化推理和几何精度。教师模型引入了反思性推理,其中 VLM 生成逻辑解释,然后在 真值 操作的监督下反思性地完善推理。这增强了零样本泛化,无需中间标签。学生模型通过监督 微调 提炼出教师的推理能力。我们还设计了一个单独的路点解码器,将文本推理解释为连续轨迹。我们提出的解决方案集成了两个目标:为可解释性提供明确的推理,并提供强大而准确的驾驶性能。它利用分阶段推理引擎中这两个目标之间的协同作用来提高驾驶性能,并明确使用推理来指导驾驶预测。在 Waymo 基准测试中进行评估,我们的框架在零样本推理、航路点准确性和推理效率方面优于基于经典推理的基线。我们的实验验证了这一设计,证明推理文本对推动推理做出了重大贡献,与缺乏推理的相同模型相比,性能提高了约 24%。我们的工作将推理驱动的自动驾驶推进到可解释和可部署的系统。