论文

用于逻辑视觉异常检测的超图正常世界模型

Hypergraph Normal World Models for Logical Visual Anomaly Detection

应用与实践视觉感知与空间理解

摘要

视觉异常检测通常仅使用正常的训练图像进行部署。大多数一类检测器将测试补丁或特征映射到正态参考分布。这对于局部结构缺陷非常有效。逻辑异常是不同的。每个可见部分可能看起来正常,而整个图像违反正常计数、共现或空间关系。本文研究模型是否可以仅从标称图像中学习这种特定于类别的正常世界。我们提出了超图正常世界模型,这是一种仅正常的检测器,可将冻结的 DINOv2 补丁标记提炼为补丁、关系和超图统计数据。它在词元组上构建空间超边缘。然后,它使用区分局部证据、关系证据、超边缘证据和超边缘关系证据的信息商对每个测试图像进​​行评分。在可用的 MVTec LOCO 早餐盒验证数据上,完整的超图模型将逻辑异常 AUROC 从 DINOv2 patch-kNN 的 0.8434 改进到 0.9279。它还比非超图变体有所改进,从 0.9013 到 0.9279。少量实验表明,该模型对于非常有限的正常图像仍然有效。我们还测试分数是否反映了正常世界的知识而不是浅层映射。 t-SNE 分离学习能量空间中的逻辑异常。关系反事实使信息商平均增加 83.13。随机超图减少了逻辑 AUROC,并且超边缘归因在逻辑异常上要大得多。定性例子表明,高分是由关系术语驱动的。这些结果表明,逻辑视觉异常检测应该模拟正常关系,而不仅仅是正常的局部斑块。