论文
建立可靠的自动驾驶视觉语言模型
Towards Reliable Vision-Language Models for Autonomous Driving
摘要
视觉语言模型 (VLM) 在自动驾驶领域得到越来越多的探索,用于场景理解、驾驶推理、决策和端到端驾驶等任务。随着它们的作用变得更加突出,确保它们的鲁棒性和可靠性变得越来越重要。在现实条件下,视觉输入可能会因传感器缺陷和环境条件而降低,从而可能影响模型预测及其相关的置信度。这种退化在自动驾驶中尤其令人担忧,其中安全关键决策要求模型做出准确的预测并识别预测何时可能不可靠。在这项工作中,我们在四个驾驶相关的 QA 数据集上使用不同的视觉输入设置(包括单帧、多视图、多帧和单眼输入)评估了 5 个 VLM(Qwen3.5-9B、Gemma4-E4B、LLaVA-OneVision-7B、DriveFusion/DriveFusionQA-4B 和 NVIDIA Alpamayo-1.5-10B)。我们的结果表明,视觉损坏的影响因模型、数据集和输入设置而异,准确性和置信度可靠性也会发生变化,并且在不同条件下也会有所不同。然后,我们应用视觉证据增强($V{\scriptstyle EA}$),这是一种最近的推理时间方法,以检查它是否可以在视觉退化条件下提高模型的可靠性。我们发现 $V{\scriptstyle EA}$ 提高了某些模型和数据集的性能,尽管所有设置的增益并不一致。