论文

看到更多,检测更少?抑制多视图异常检测中的信息泄漏

See More, Detect Less? Taming Information Leakage in Multi-View Anomaly Detection

模型架构Transformer

摘要

在多视图异常检测中,更多的跨视图信息实际上会造成伤害。当多个检查视图被简单地融合在基于重建的管道中时,来自完整视图的正常线索会传播到解码器,解码器忠实地重建异常区域,从而缩小检测器所依赖的重建间隙。我们将这种故障模式称为\emph{跨视图信息泄漏},并表明有效的多视图融合必须明确限制到达解码器的信息。基于这一见解,我们提出了 GLAD(全局-局部注意力驱动框架),这是第一个将视觉基础模型特征与局部和全局跨视图融合相结合的框架,用于多视图异常检测。多视图合并注意力(MMA)模块以线性复杂度执行局部跨视图融合,并具有可学习的视图重要性加权和标记明智的门控,让每个视图以 $\mathcal{O}(N)$ 成本选择性地合并来自其他视图的细粒度证据。对象引导注意力(OGA)模块通过将所有视图中的类标记聚合成单个对象级表示并通过温度缩放的 sigmoid 门将其广播回补丁标记来捕获全局上下文,替换原始补丁表示而不是添加残差以保留重建间隙。 Real-IAD 和 MANTA-Tiny 上的实验表明,GLAD 在样本、图像和像素级指标上都优于最先进的方法,证实了原则性信息限制是多视图异常推理的关键。