论文
文本引导异常检测的结构化基准:当语言停止调节决策时
A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision
摘要
工业异常检测历来是一项单峰任务。最近的多模态视觉语言模型已经产生了允许在图像旁边输入文本的系统,并被呈现为支持文本引导的零次和少次检测。然而,这些方法是使用从单峰基准继承的协议进行评估的,这些基准保持文本条件不变,因此无法衡量语言是否影响决策;报告的收益是否反映了文本指导或强大的预训练视觉特征仍然悬而未决。我们引入了文本引导异常检测 (TGAD),这是一种结构化基准,可在三种场景中逐步增强语言的功能作用:MVTec AD 上的受控提示灵敏度设置; MVTec AD 的组件标记扩展,要求模型将其评估限制在指定部分;以及新的组装面板数据集 (APD),这是一个需要缺陷类型和组件位置知识的现实工业环境。我们评估每种范式的一个代表性模型:生成式大型视觉语言、无需训练 判别模型和嵌入自适应判别模型。在这三种情况下,文本界面仅在表面上限制了决策:除非删除宾语名词,否则提示内容会被吸收(生成模型的 I-AUROC 从 97.4 下降到 82.6);一旦指令部分以外的缺陷被视为正常(从 90.3 到 66.3),组件级指令不会限制决策;当两者在 APD 上结合时,图像级辨别力低于 MVTec 水平,在一种情况下低于机会值(71.2、50.5、31.5)。这些结果表明,标准基准夸大了当前多模式异常检测系统的文本引导功能,并且此类协议是可以通过工业部署语言可靠控制的模型的先决条件。