论文

CoReVAD:无需训练 视频异常检测的上下文推理框架

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

上下文与知识上下文工程

摘要

现有的视频异常检测(VAD)方法通常依赖于特定任务的训练,导致很强的领域依赖性和高昂的训练成本。此外,大多数现有方法仅输出标量异常分数,对为什么特定事件被认为是异常的了解有限。视觉语言模型 (VLM) 的最新进展实现了异常检测和人类可解释的推理。然而,许多基于 VLM 的方法仍然需要额外的训练步骤(例如指令调整或语言学习)或外部 大语言模型 (LLM),从而产生进一步的训练成本和推理开销。为了应对这些挑战,我们提出了 CoReVAD,这是一种用于 无需训练 视频异常检测的上下文推理框架,可与单个冻结 VLM 一起运行。 CoReVAD 直接从 VLM 生成异常分数和时间描述。为了减轻生成输出中的噪声,我们引入了基于局部视觉文本对齐的局部响应清理(LRC)模块。此外,通过基于 softmax 的细化、高斯平滑和位置加权,整合了全局时间上下文和进程。 UCF-Crime 和 XD-Violence 上的实验表明,CoReVAD 在 无需训练 方法中实现了具有竞争力的性能,同时提供了可靠且可解释的解释。我们的官方代码位于:https://github.com/Muk-00/CoReVAD