论文
通过从粗到细的 VLM 跟踪管道进行零样本交通事故检测
Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline
摘要
交通监控摄像机连续捕捉事故,但将原始闭路电视录像转换为结构化事件记录,以查明发生碰撞的时间、地点和类型,但仍未大规模解决。 ACCIDENT @ CVPR 基准在严格的约束下精确评估这种联合预测:没有可用的标记的真实世界训练数据。我们引入了 无需训练,即两遍从粗到精的管道,它将冻结的 Qwen3-VL-32B-Instruct 视觉语言模型与 YOLO11x 对象检测和 BoT-SORT 跟踪配对。第一遍对整个剪辑进行稀疏采样,以及时锚定碰撞时刻;第二遍使用用稳定车辆身份和标准化边界框坐标注释的帧重新检查估计周围的紧密窗口,这为模型提供了同一场景的视觉覆盖和明确的数字描述。在官方的 2,027 片段真实闭路电视测试集上,我们的系统实现了 0.504 的三向调和平均得分,超过了所有组织者发布的基线,包括最佳多模型集成 (0.412),相对优势为 22%。