论文
CAViAR:用于现实场景中细粒度事故推理的因果视频数据集
CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios
摘要
虽然现代自动驾驶系统擅长物体检测和轨迹预测等感知任务,但它们缺乏解释交通事故所需的高级因果推理。特别是,在当前的基准测试中,很大程度上仍未探索确定责任,例如确定谁有过错以及违反了哪条交通规则。为此,我们引入 CAViAR(因果事故视频和事故分析存储库),这是一个人工注释的行车记录仪基准测试,包含从 CarCrashDataset (CCD) 和 Nexar 收集的 2,249 个真实世界事故视频。每个视频都附有结构化标签,涵盖环境条件、事故类型、因果解释、明显的过失人员、受影响的人员和明显的违规类别。我们对最先进的视觉语言模型 (VLM) 进行基准测试,包括 Cosmos-Reason2、Qwen3-VL 和 InternVL3。一旦用多数/随机基线和平衡指标来考虑类别不平衡,感知能力就会不均匀——照明几乎解决了,而天气和路况准确性则落在或低于多数类别基线——并且所有模型在事故类型和责任推理上都会急剧下降。总体而言,CAViAR 暴露了一个实际的感知-推理差距:当前的 VLM 可以识别显着的上下文,但不能可靠地将可见代理操作映射到安全关键驾驶场景中带注释的规则相关责任类别。代码、注释模式、提示和评估脚本可从以下位置获取:https://github.com/nec-labs-ma/CAViAR