论文

Proximity-CLIP:用于零样本异常检测的文本引导语义邻近学习

Proximity-CLIP: Text-Guided Semantic Proximity Learning for Zero-Shot Anomaly Detection

模型架构新型架构

摘要

视觉语言模型为零样本异常检测(ZSAD)提供了一种有前景的方法。然而,由于以对象为中心的偏见,正常和异常文本原型表现出高度的语义重叠。虽然在它们之间强制执行严格的正交性可以提高可辨别性,但将高度连续的视觉输入映射到完全正交的原型上会引入几何困境,破坏预先训练的结构连续性。为了解决这个问题,我们提出了 Proximity-CLIP,一个可以在视觉上校准语义边缘以指导视觉适应的框架。首先,我们引入了一种视觉校准的语义邻近学习机制,该机制使用有界动态正则化来学习适当的语义边缘,确保区分性分离,同时保持结构对齐。其次,我们设计了一个由这些文本先验驱动的异常查询模块(AQM)。使用校准的异常原型作为语义查询,AQM 主动从上下文视觉斑块中检索局部缺陷线索,从而减轻全局池化过程中细微异常的稀释。大量实验表明,Proximity-CLIP 在多个 ZSAD 基准测试中优于当前最先进的方法,并且只需进行最少的架构修改。