论文

Orion-Lite:将 LLM 推理提炼为高效的纯视觉驾驶模型

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

摘要

利用 大语言模型 (LLM) 的通用知识对于提高自动驾驶系统处理罕见和复杂场景的能力具有重大前景。虽然将 LLM 集成到视觉-语言-动作 (VLA) 模型中已经产生了最先进的性能,但其大量参数对延迟敏感和节能部署提出了严峻的挑战。将 LLM 知识提炼成紧凑的驾驶模型提供了一个引人注目的解决方案,可以保留这些推理能力,同时保持可管理的计算足迹。尽管之前的工作已经证明了 蒸馏 的功效,但这些工作主要集中在相对简单的场景和开环评估上。因此,在这项工作中,我们在闭环评估下在更复杂的交互式场景中研究 LLM 蒸馏。我们证明,通过潜在特征 蒸馏 和 真值 轨迹监督的组合,高效的仅视觉学生模型 \textbf{Orion-Lite} 甚至可以超越其大规模 VLA 教师 ORION 的性能。在严格的 Bench2Drive 基准测试中创下了新的最先进水平,驾驶得分为 80.6。最终,这表明仅视觉架构在高性能反应性规划方面仍然具有巨大的、尚未开发的潜力。