论文
后来:测试时上下文感知可解释视频异常检测
LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection
摘要
视觉语言模型(VLM)由于其强大的视觉推理能力和基于自然语言的可解释性,最近成为视频异常检测(VAD)的有前途的范例。在本文中,我们的目标是解决此类管道的一个关键限制,即由于词元约束和没有结构化时间上下文的推理而独立执行分段级推理,从而允许 VLM 将异常解释为与不断发展的视频动态的偏差,而不是产生碎片化的预测和解释。为了具体说明,我们提出了一个名为 LATERN 的上下文感知框架,它将 VAD 重新表述为时间证据聚合过程。 LATERN 由两个互补模块组成:上下文感知异常评分 (CEA) 和递归证据聚合 (REA)。 CEA 引入了一种新颖的基于图像的记忆机制,该机制通过帧多样性和视觉文本对齐选择性地选择历史内容作为扩展上下文,以帮助生成可靠的异常分数。基于这些分数,REA 执行递归时间聚合,以识别连贯的异常间隔,并生成基于视觉文本证据的事件级决策和解释。对具有挑战性的基准(包括 UCF-Crime 和 XD-Violence)进行的广泛实验表明,LATERN 提高了测试期间冻结 VLM 的检测准确性和解释一致性,同时生成时间连贯且语义视听证据关联的事件级解释。