论文

视觉语言模型对连续驾驶场景的理解程度如何?敏感性研究

How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study

模型评测模型能力评测

摘要

视觉语言模型(VLM)越来越多地被提出用于自动驾驶任务,但它们在顺序驾驶场景上的性能仍然缺乏表征,特别是在输入配置如何影响其功能方面。我们引入了 VENUSS(理解连续场景的 VLM 评估),这是一个对连续驾驶场景的 VLM 性能进行系统敏感性分析的框架,为未来的研究建立基线。 VENUSS 以现有数据集为基础,从驾驶视频中提取时间序列,并生成跨自定义类别的结构化评估。通过比较 2,600 多个场景中的 25 多个现有 VLM,我们揭示了即使是顶级模型也只能达到 57% 的准确度,与类似约束下的人类表现 (65%) 不匹配,并暴露出显着的能力差距。我们的分析表明,VLM 在静态物体检测方面表现出色,但在理解车辆动力学和时间关系方面存在困难。 VENUSS 首次提供了 VLM 的系统灵敏度分析,重点关注输入图像配置(分辨率、帧数、时间间隔、空间布局和呈现模式)如何影响连续驾驶场景的性能。补充材料可在 https://TUM-AVS.github.io/VENUSS/ 获取。