论文

用于视频异常检测和预测的统一分数匹配范式

A Unified Score Matching Paradigm for Video Anomaly Detection and Anticipation

模型评测应用与实践鲁棒性、公平性与可信度评测视觉感知与空间理解

摘要

视频异常检测(VAD)是计算机视觉中的一项基本且安全关键的任务。最近的生成方法从分布角度检测异常,但仍然受到局部异常模式的限制。与此同时,视频异常预测(VAA)作为事后检测之外的主动扩展,带来了额外的挑战。特别是,VAD中依赖于真实框架的对比推理范式不适用于VAA,阻碍了其发展。为了应对这些挑战,我们提出了一个基于去噪得分匹配(DSM)的统一得分驱动框架,称为 Uni-DSM,该框架通过学习数据分布上的似然估计和得分函数来对异常模式进行建模。在这个统一的框架内,我们采用共享噪声调节得分Transformer主干,具有场景相关嵌入和运动感知权重,用于分布级建模。 Uni-DSM 没有引入单独的架构,而是通过基于相同基于分数的不同推理和监督范例来统一 VAD 和 VAA 配方。对于 VAD,我们实例化了一种自回归去噪评分匹配 (ADSM) 机制,该机制通过自回归去噪逐步积累异常证据,从而增强对视觉线索之外的局部模式的感知。对于 VAA,我们通过合并轻量级辅助解码器和新颖的自蒸馏去噪分数匹配(SDSM)机制来扩展相同的架构。通过根据输出差异构建监督,而不是依赖于不可用的未来真实情况,我们的方法实现了有效的训练合适或早期异常预期。对多个基准数据集的广泛实验证明了 VAD 和 VAA 的最先进性能,同时保持高效率,建立了从异常检测到预测的统一且可扩展​​的管道。