论文
用于零次事故理解的元数据感知多提示推理
Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding
摘要
在本文中,我们通过使用自然语言识别撞击事件发生的时间、撞击的类型以及撞击发生在画面中的位置,解决了对监控视频中的事故进行零镜头理解的问题。我们提出了一个三阶段管道,将事故理解分解为时间、事件和地点。第一阶段利用视觉语言相似性提取影响周围的短时间窗口。在第二阶段,我们使用五个互补视图(基线、运动、几何、对比度和决胜局)执行元数据驱动的多提示推理,并通过熵门控成对裁决器解决分歧。最后,我们定位了查询的开放词汇检测器对预测事故类型和场景布局的影响,并使用分数加权质心聚合跨关键帧的检测。我们的流程在零样本事故 @ CVPR 基准上的调和平均得分比帧中心基线有了显着提高。我们表明,将零样本视频理解分解为时间定位、语义分类和空间定位,可以使用视觉语言模型进行比单独直接提示更可靠的推理。