论文

VLM 答案不是异常分数:跨图像和视频异常检测的排名压缩

A VLM Answer Is Not an Anomaly Score: Rank Compression Across Image and Video Anomaly Detection

模型评测评测方法与指标

摘要

异常检测旨在识别偏离正常模式的观察结果。最近的工作越来越多地使用预训练的视觉语言模型(VLM)来进行 无需训练 图像和视频异常检测,而无需特定于任务的重新训练。异常检测通常通过异常分数将异常图像或视频帧排列在正常图像或视频帧之上的程度来评估。然而,生成式 VLM 会为可能的答案分配概率,然后解码单个答案。该解码步骤可以丢弃排序信息。我们将这种损失称为解码答案排名压缩。为了隔离这种影响,我们比较了对相同 VLM 输出进行评分的两种方法:一种仅使用解码后的答案,而另一种则计算所有可能答案的概率加权分数。使用不同的 VLM 和答案量表,在图像和视频异常检测基准中,概率加权评分始终优于解码答案评分。主要指标的平均增益范围为 7.66 至 19.95 点。这种差距大部分来自解码答案关系。打破解码答案与答案概率的联系可以恢复每个基准测试中至少 95% 的平均性能差距。我们进一步研究这些关系如何影响评估。我们发现,一次评估一个输入的并列分数会使报告的 AUROC 依赖于输入顺序,并且线性 PR 插值会夸大报告的性能。这些结果表明,VLM 输出的评分方式以及离散异常评分的评估方式都会影响报告的异常检测性能。