论文

AutoDriDM:自动驾驶视觉语言模型决策的可解释基准

AutoDriDM: An Explainable Benchmark for Decision-Making of Vision-Language Models in Autonomous Driving

模型评测基准与评测资源

摘要

自动驾驶是一个极具挑战性的领域,需要在复杂场景下进行可靠的感知和安全的决策。最近的视觉语言模型(VLM)展示了推理和泛化能力,为自动驾驶开辟了新的可能性;然而,现有的基准和指标过分强调感知能力,未能充分评估决策过程。在这项工作中,我们提出了 AutoDriDM,这是一个以决策为中心的渐进基准,包含跨越三个维度(对象、场景和决策)的 6,650 个问题。我们评估主流的 VLM 来描绘自动驾驶中感知到决策的能力边界,我们的相关分析揭示了感知和决策性能之间的弱一致性。我们进一步对模型的推理过程进行可解释性分析,识别逻辑推理错误等关键故障模式,并引入分析器模型来自动进行大规模注释。 AutoDriDM 弥合了以感知为中心的评估和以决策为中心的评估之间的差距,为现实世界的自动驾驶提供更安全、更可靠的 VLM 指导。