论文
Cog-VADU:用于视频异常检测和理解的免训练认知推理框架
Cog-VADU: A Training-Free Cognitive Reasoning Framework for Video Anomaly Detection and Understanding
摘要
视频异常检测(VAD)旨在暂时定位视频中的异常事件。大多数现有方法依赖于特定于数据集的训练和精选注释,限制了开放集场景中的泛化。最近基于大视觉语言模型(LVLM)的零样本方法减轻了这种依赖性,但通常缺乏时间连续性和结构化推理。我们提出了 Cog-VADU,这是一个完全免训练的框架,它将 VAD 重新表述为顺序认知推理任务。 Cog-VADU 引入了异常检测思维提示链 (CoADTP),它将 LVLM 展开为跨视频片段的循环推理链。通过随时间传播结构化原理,该模型保持隐式时间记忆,从而能够稳健地区分复杂异常和高速运动的正常活动。为了提高可靠性,我们进一步设计了一个跨模式重新排序阶段,将文本原理与视觉嵌入保持一致,增强语义一致性和时间连贯性,以实现精细且稳定的预测。对多个公共 VAD 基准的大量实验表明,Cog-VADU 实现了有竞争力的零样本性能。此外,跨模型评估表明,CoADTP 始终以与模型无关的方式增强基于推理的异常检测,为现实世界的应用提供可解释和可概括的异常理解。