论文
使用多模式违规数据集进行端到端驾驶的碰撞感知视觉语言学习
Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
摘要
高违规率仍然是端到端 (E2E) 自动驾驶的主要瓶颈,CARLA 排行榜上的低驾驶分数就证明了这一点。尽管与碰撞相关的违规行为是闭环评估中的主要故障模式,但碰撞感知表示学习受到的关注有限。为了解决这一差距,我们首先开发了视频语言增强异常检测器(VLAAD),利用多实例学习(MIL)公式来获取稳定的、时间局部的碰撞信号以进行主动预测。为了将这些功能转变为闭环模拟,我们必须克服现有模拟器数据集的局限性,这些数据集缺乏多模态性,并且经常仅限于简单的交叉路口场景。因此,我们引入了 CARLA-Collide,这是一个大规模多模式数据集,可捕获高度多样化的道路网络中的真实碰撞事件。 VLAAD 在这些多样化的模拟器数据上进行训练,作为碰撞感知插件模块,可以无缝集成到现有的 E2E 驾驶模型中。通过将我们的模块集成到预训练的 TransFuser++ 代理中,我们证明了在最小 微调 的情况下,驾驶分数相对提高了 14.12%。除了闭环评估之外,我们还使用真实驾驶数据在开环设置中进一步评估 VLAAD 的泛化能力。为了支持这种分析,我们引入了 Real-Collide,这是一个包含多种行车记录仪视频的多模态数据集,并配有用于碰撞检测和预测的语义丰富的注释。在此基准测试中,尽管 VLAAD 仅包含 0.6B 个参数,但其性能优于数十亿参数的视觉语言模型,AUC 提高了 23.3%。