论文
更好的视觉表示是否总能改善端到端自动驾驶?
Do Better Visual Representations Always Lead to Better End-to-End Autonomous Driving?
摘要
视觉基础模型(VFM)因其强大的表示而越来越多地集成到端到端自动驾驶中,但目前尚不清楚这些表示何时可以提高驾驶性能。为了研究这个问题,我们引入了 ViRA,一种与规划器无关的视觉表示对齐框架,可以保持规划器架构和推理成本不变。我们的研究揭示了三个发现:(1)VFM 引导的视觉表示持续改善不同端到端规划器的驾驶性能,并将收益扩展到零样本闭环评估。 (2) VFM 目标的选择对于规划性能至关重要,并且与不同的 VFM 保持一致可以进一步使具有预训练 VFM 编码器的规划人员受益。 (3) 辅助感知监督降低了对 VFM 目标选择的敏感性,将五个目标的 EPDMS 分布从 2.7 点缩小到 0.5 点,并可能补偿效率较低的 VFM 目标。在这些发现的指导下,我们开发了 ViRA-Diffusion,这是一种基于扩散的规划器,无需辅助感知监督即可进行训练, 在 NAVSIM v2 navtest 上达到 92.3 EPDMS,比我们比较中的最新方法至少高出 1.9 个点。结果促使在将 VFM 集成到端到端自动驾驶时共同考虑目标选择和规划器监督。结果和演示可在 https://github.com/OpenDriveLab/ViRA。 获取
