论文
MOJITO:统一端到端自动驾驶的模态联合学习
MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving
摘要
端到端自动驾驶系统通常遵循级联的两级管道,其中感知阶段将多模态传感器输入压缩到紧凑的环境中,下游规划器根据该环境预测轨迹。我们认为,这种单向感知到规划的接口迫使传感器输入变成一种紧凑的表示形式,从而丢失了对规划至关重要的细粒度细节。此外,通过将规划器限制在这种压缩的环境中,很难利用现代视觉基础模型提供的丰富表示。为了解决这些问题,我们提出了 MOJITO,这是一个基于模态联合学习的端到端自动驾驶的统一传感器到行动框架。 MOJITO 删除了级联接口,而是执行分块模态联合注意,同时更新动作、图像和 LiDAR 特征,允许规划器在动作生成过程中直接访问多模态特征。 MOJITO 在 NAVSIM v1 数据集上实现了 88.9 PDMS,在更具挑战性的 NAVSIM v2 数据集上实现了 88.4 EPDMS,创下了新的最先进水平。大量的实验进一步证明了强大的可扩展性、指令跟踪和多样化的轨迹生成。代码和模型可在 https://github.com/mumucc01/MOJITO 获取。