论文
TED:提示异常定位的文本轴证据分解
TED:Text-Axis Evidence Decomposition for Prompted Anomaly Localization
摘要
CLIP 是一种强大的视觉语言模型,但它并不是为细粒度缺陷定位而设计的;因此,基于 CLIP 的异常检测器可以通过提示或轻量级模块对其进行调整,以提高缺陷灵敏度。我们表明,更强的敏感性并不一定使局部证据可靠:在域转移下,适应的 CLIP-AD 模型通常为真正的缺陷和视觉复杂的正常区域分配高异常分数。问题不仅仅是缺少缺陷信息,而是解码缺陷和硬正态证据的本地评分规则,具有相同的异常证据。我们提出了 TED(文本轴证据分解),这是一种事后评分方法,询问源缺陷补丁或被误认为异常的源正常补丁是否可以更好地支持每个不明确的响应。 TED 在主持人的正常与异常文本响应下比较这些支持,保持主干和提示不变,并且不需要目标域训练。它可以作为原始 VLM 主干的免训练分数,或作为改编后的 CLIP-AD 主机的源校准残差校正。在冻结的 VLM 主干上,TED 显着改善了原始提示相似性的像素级定位;在适配的主机中,它比 P-AUROC、P-PRO 和 P-AP 改进了大多数像素级设置。在更强的硬 FP 竞争下收益最大,平均本地化收益从低竞争体制中的 +5.0 增加到中/高竞争体制中的约 +10.9。这些结果表明,可恢复的缺陷证据已经存在于预训练的多模态表示中,但可靠的定位需要针对硬常态竞争者对其进行解码。代码将在 TED GitHub 存储库中发布。