论文

GridVAD:通过分层框架网格上的空间推理进行开放集视频异常检测

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

应用与实践行业应用

摘要

视觉语言模型(VLM)是强大的开放式推理机,但它们在视频监控中直接用作异常检测器是脆弱的:如果没有校准的异常先验,它们就会在漏检和幻觉误报之间交替。我们认为问题不在于 VLM 本身,而在于它的使用方式。 VLM 应充当异常提议者,生成开放集候选描述,然后由专门构建的空间和时间模块进行基础和跟踪。我们在 GridVAD 中实例化了这一提议地面传播原理,这是一个 无需训练 管道,无需任何特定领域的训练即可生成像素级异常掩模。 VLM 对视频剪辑的分层网格表示进行推理,以生成自然语言异常建议。自一致性整合 (SCC) 通过仅保留在多个独立采样中重复出现的提议来过滤幻觉。 Grounding DINO 将每个幸存的提案锚定到一个边界框,而 SAM2 将其作为密集掩模传播到异常区间。无论视频长度如何,每个剪辑的模型预算都固定为 M+1 次调用,其中 M 可以根据需要的建议进行设置。在 UCSD Ped2 上,GridVAD 在所有比较方法中实现了最高的 Pixel-AUROC (77.59),甚至超过了部分微调的 TAO (75.11),并且在对象级 RBDC 上的性能比其他零样本方法高出 5 倍以上。消融表明,SCC 提供了可控的精确召回权衡:过滤以适度的对象级召回成本改善了所有像素级指标。效率实验表明,GridVAD 的调用效率比统一的每帧 VLM 查询高 2.7 倍,同时还生成密集的分段掩模。代码和定性视频结果可在 https://gridvad.github.io 上获得。