论文

更好的视觉表示是否总能改善端到端自动驾驶?

Do Better Visual Representations Always Lead to Better End-to-End Autonomous Driving?

模型评测模型优化应用与实践蒸馏模型行为与机制分析机器人

摘要

视觉基础模型(VFM)因其强大的表示而越来越多地集成到端到端自动驾驶中,但目前尚不清楚这些表示何时可以提高驾驶性能。为了研究这个问题,我们引入了 ViRA,一种与规划器无关的视觉表示对齐框架,可以保持规划器架构和推理成本不变。我们的研究揭示了三个发现:(1)VFM 引导的视觉表示持续改善不同端到端规划器的驾驶性能,并将收益扩展到零样本闭环评估。 (2) VFM 目标的选择对于规划性能至关重要,并且与不同的 VFM 保持一致可以进一步使具有预训练 VFM 编码器的规划人员受益。 (3) 辅助感知监督降低了对 VFM 目标选择的敏感性,将五个目标的 EPDMS 分布从 2.7 点缩小到 0.5 点,并可能补偿效率较低的 VFM 目标。在这些发现的指导下,我们开发了 ViRA-Diffusion,这是一种基于扩散的规划器,无需辅助感知监督即可进行训练, 在 NAVSIM v2 navtest 上达到 92.3 EPDMS,比我们比较中的最新方法至少高出 1.9 个点。结果促使在将 VFM 集成到端到端自动驾驶时共同考虑目标选择和规划器监督。结果和演示可在 https://github.com/OpenDriveLab/ViRA。 获取

更好的视觉表示是否总能改善端到端自动驾驶?:论文原图
图 S.1:ViRA 的流程。多视图图像由规划器编码器和冻结的 VFM 目标进行编码,生成学生和 VFM 表示。 VFM 表示仅监督潜在对齐,而不被注入到策略头中。策略头仅对规划器表示进行操作,并且 VFM 分支在训练后被删除,不会产生推理开销。 Q、K、V 分别表示查询、键、值; KL 表示 Kullback-Leibler 散度; CE表示交叉熵。