论文
CrashSight:用于交通事故场景理解和推理的阶段感知、以基础设施为中心的视频基准
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
摘要
协同自动驾驶需要从车辆和基础设施的角度理解交通场景。虽然视觉语言模型(VLM)显示出强大的一般推理能力,但由于现有基准测试以自我车辆为中心,因此其在安全关键交通场景中的性能仍未得到充分评估。为了弥补这一差距,我们提出了 \textbf{CrashSight},这是一种使用真实路边摄像头数据来理解道路碰撞的大规模视觉语言基准。该数据集包含 250 个崩溃视频,并用按照两层分类法组织的 13K 多项选择题答案对进行注释。第一层评估场景背景和相关各方的视觉基础,而第二层则探讨更高层次的推理,包括碰撞机制、因果归因、时间进程和碰撞后结果。我们对 8 个最先进的 VLM 进行了基准测试,结果表明,尽管具有强大的场景描述能力,但当前模型在安全关键场景中难以进行时间和因果推理。我们提供了对故障场景的详细分析,并讨论了提高 VLM 崩溃理解的方向。该基准为协作自动驾驶中的基础设施辅助感知提供了标准化的评估框架。 CrashSight 基准测试(包括完整的数据集和代码)可通过 https://mcgrche.github.io/crashsight 访问。