论文
PaSBench-Video:主动安全警告的流媒体视频基准
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
摘要
在第一个明显的危险迹象和事故发生的那一刻之间,通常存在一个可以进行干预的窗口期。具有视频功能的多模式 大语言模型 (MLLM) 可以充当始终在线的安全监视器,在此窗口期间发出警告。然而,当前的基准测试并没有测试这种能力:它们依赖于静态输入,忽略计时精度,并忽略安全场景中的误报测量。我们推出 PaSBench-Video,这是一个包含 740 个视频的基准测试,其中包含 481 个风险视频和 259 个无风险视频,涵盖四个领域:驾驶、医疗保健、日常生活和工业生产。风险视频带有帧级风险发生和事故边界注释。模型必须因果地观察视频并产生时间校准且内容正确的警告。测试 13 个 MLLM,我们发现在我们最严格的指标上没有模型超过 20.0%,并且召回率与假阳性率紧密相关,皮尔逊相关性为 0.64:更高的检测率只会以触发大多数安全剪辑的警告为代价。不同领域的性能差异很大:在日常生活中,模型以较低的误报率实现了中等召回率,其中风险本质上是异常的,但在驾驶中,模型会不加区别地开火,因为日常场景和危险场景看起来很相似。这些结果表明,当前的模型依赖于场景级活动线索,而不是对新出现的危害进行推理。