论文

重新思考多模态零样本异常检测中的辅助模态:从语义融合到条件调制

Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation

应用与实践视觉感知与空间理解

摘要

最近基于基础模型的方法通过视觉语言预训练赋予 RGB 图像强大的零样本异常检测(ZSAD)能力。然而,仅 RGB 观测在感知以几何变形、深度变化或细微表面变化为主的异常方面仍然有限。辅助模态可以提供补充的结构信息,但现有的多模态方法通常将它们直接融合到共享语义空间中,这可能会干扰 RGB 基础模型建立的文本对齐异常语义,并且通常需要特定于模态的架构。为了解决这个问题,我们提出了一种用于零样本异常检测的即插即用辅助条件增强框架。我们的框架没有重建联合多模态异常语义空间,而是保留了原始的 RGB 图像文本异常匹配路径,并使用辅助观察作为 RGB 特征细化的条件信号,允许辅助模态无缝增强现有的基于 RGB 的零样本异常检测器。具体来说,轻量级元学习模块将全局 RGB 和辅助表示作为输入,并生成样本自适应低秩残差更新,以确定如何细化 RGB 特征。我们进一步从初始 RGB 异常响应和辅助可靠性构建不确定性感知空间调制,这决定了局部残差更新的加强或抑制。这种全局到局部的条件调制可以实现选择性多模态增强,同时保留原始的 RGB 异常语义。 MVTec 3D-AD 和 Eyecandies 上的大量实验表明,我们的框架持续改进了多种流行的基于 RGB 的零样本异常检测器,实现了多模态零样本异常检测的最先进性能。