论文

GenAU:使用视觉语言模型进行基于语言的工业异常理解

GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models

模型训练监督微调与指令调优

摘要

工业检查需要的不仅仅是二元异常检测:实用的系统应该确定是否存在异常、定位缺陷区域、识别缺陷类型并提供可解释的视觉证据。现有的基于 CLIP 的方法可以很好地检测和定位异常,但提供的语言级缺陷理解有限,而指令调整的视觉语言模型可以描述缺陷,但本身不能生成像素级掩模。我们介绍 GenAU,这是一种用于工业异常理解的通用视觉语言框架,它将图像级检测、像素级分割、多类型异常检测和缺陷分析统一在单个指令跟踪模型中。 GenAU 使用两个分割标记 [SEG_defect] 和 [SEG_normal] 增强了视觉语言模型,其隐藏状态充当对多尺度视觉特征的基于语言的查询,以实现像素级定位;图像级分数将该图与解码器的文本正常/缺陷决策融合,而语言解码器产生结构化的缺陷感知响应。 GenAU 采用联合语言建模和分割目标进行训练,涵盖了一种架构和配方中的所有四项任务,以量化的检测和分割成本添加了零样本多类型检测和基于语言的缺陷分析。在跨数据集基准测试中,GenAU 在 VisA 和 Real-IAD 上基于 CLIP 的零样本方法中实现了最强的图像级检测,分割接近但没有超过专门的 CLIP 基线。