论文
基准 AUC 不可部署可靠性:对监控视频异常检测的现成功能进行跨数据集审核
Benchmark AUC Is Not Deployable Reliability: A Cross-Dataset Audit of Off-the-Shelf Features for Surveillance Video Anomaly Detection
摘要
自动“可疑行为”标记是人工智能监控的主要承诺,该领域在标准视频异常检测基准上报告了高帧级 ROC-AUC。这些数字是通过在同一摄像机和场景上进行训练和测试来测量的。我们会审核当该假设被放弃时会发生什么。我们使用冻结的现成嵌入(CLIP、DINOv2、ResNet-50、EfficientNet-B0)和最近邻距离,从一个数据集的全正态训练帧构建无监督正态模型,并对同一数据集和其他数据集的测试帧进行评分。在 4 个真实数据集(UCSD Ped1、UCSD Ped2、CUHK Avenue、上海科技大学)和 4 个骨干网中,相同数据集 AUC 平均值为 0.704,但跨数据集 AUC 平均值为 0.499,这是偶然的:在一个场景上校准的检测器并不比在另一个场景上抛硬币更好,而且在几对中,它低于偶然性。最强的主干网使情况变得更糟,而不是更好:DINOv2 具有最佳的相同数据集 AUC(在 Ped2 上高达 0.901)和最大的跨数据集下降。崩溃并不是评分规则的人为因素:用 PaDiM 型 Mahalanobis 检测器替换最近邻检测器几乎可以准确地再现它(跨数据集差距 0.202 与 0.208)。即使在有利的工作点,误报率也约为每小时 31,931 次。我们得出的结论是,监视异常检测引用的基准数字描述了校准的实验室设置,并大大夸大了可部署的可靠性,并且我们发布了重现每个数字的代码。