论文

Drive-KD:自动驾驶中VLM的多教师蒸馏

Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving

摘要

自动驾驶是一项重要且安全攸关的任务,LLM/VLM的最新进展为该领域的推理和规划开辟了新可能。然而,大模型需要大量GPU显存且推理延迟高,而传统监督微调(SFT)常难以弥补小模型的能力差距。为解决这些局限,我们提出Drive-KD,一个将自动驾驶分解为“感知-推理-规划”三元组并通过知识蒸馏迁移这些能力的框架。我们识别出层级特定注意力作为蒸馏信号,构建能力专属的单教师模型,其表现超越基线。此外,我们将这些单教师设置统一为多教师蒸馏框架,并引入非对称梯度投影以缓解跨能力梯度冲突。大量评估验证了我们的方法在不同模型家族和规模上的泛化性。实验表明,我们蒸馏的InternVL3-1B模型以约42分之一的GPU显存和约11.4倍的吞吐量,在DriveBench上取得优于同家族预训练78B模型的整体性能,并在规划维度超越GPT-5.1,为高效自动驾驶VLM提供了洞见。

Drive-KD:自动驾驶中VLM的多教师蒸馏
图1:Drive-KD 多教师蒸馏框架。三位教师在学生的不同层蒸馏注意力:Perception/Planning 使用第一层/倒数第二层的跨模态注意力;Reasoning 使用分组匹配的中间层全注意力。学生还在输出端接受硬标签监督训练。我们应用 AGP 来缓解跨能力梯度冲突。