论文

Probe-VAD:用于免训练视频异常检测的序数似然探测

Probe-VAD: Ordinal Likelihood Probing for Training-Free Video Anomaly Detection

模型推理推理验证与自校正

摘要

视频异常检测(VAD)旨在定位未修剪视频中的异常事件。视觉语言模型 (VLM) 为免训练 VAD 提供了丰富的视觉理解,但现有方法在视觉理解和异常评分之间施加了限制性接口。基于字幕的管道将视觉证据压缩为文本,可能会丢弃微妙的线索,而直接的数字生成则迫使模型通过一小组预定义的分数来表达其判断。此类界面可能会掩盖异常严重性的细微差异,导致视觉上不同的剪辑收到相似的表示或分数,从而限制异常排名的分辨率。我们提出 \textbf{Probe-VAD},一个序数二进制探测框架,可以直接从冻结的 VLM 探测严重性偏好。给定原始视频剪辑,Probe-VAD 查询十个有序严重性阈值并提取受约束的 \textit{YES}/\textit{NO} 连续可能性。他们的标准化偏好形成了累积的严重性概况,尾部证据被聚合成连续的异常评分,并通过等张投影强制顺序一致性。公共 VAD 基准测试的实验证明了卓越的性能和较低的计算成本。 Probe-VAD 提供了一个简单的界面,用于将冻结的 VLM 视觉理解转换为连续的、排名敏感的异常分数,无需特定于任务的训练或基于字幕的压缩。代码位于:https://github.com/yvestine/COVAS-VAD。