论文
VD-DeepStack:连接视觉比较和语言推理以进行少样本异常检测
VD-DeepStack: Bridging Visual Comparison and Language Reasoning for Few-Shot Anomaly Detection
摘要
少镜头视觉异常检测从根本上来说是一项视觉比较任务,需要针对正常引用对查询进行细粒度检查。最近许多基于大型视觉语言模型(LVLM)的方法强调通过语言思维链进行比较推理。然而,离散、抽象的描述可能无法充分体现密集、细粒度的视觉差异,从而在视觉比较与其语言表达之间留下差距。为了解决这一差距,我们提出了视觉差异 DeepStack (VD-DeepStack),它明确地根据查询参考视觉差异进行语言推理。具体来说,我们将 DINO 特征与 LVLM 视觉层次融合,以增强细粒度表示,然后根据查询特征和软匹配参考特征之间的残差构建密集差异证据。差异证据路径将空间加权差异向量注入多个解码器深度的查询图像状态,而辅助视觉上下文路径提供细粒度的外观信息以支持其解释。对 4 个工业异常基准和 2 个医学异常基准的实验表明,与依赖文本比较推理的基准相比,少样本异常检测有显着改进。这些结果支持通过比较表示的联合设计及其集成到解码器中来缩小视觉比较推理差距。代码将在接受后发布。