论文

具有图像级监督的推理驱动的异常检测和定位

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 最近在异常检测方面表现出了卓越的推理和感知能力。然而,大多数方法仍然局限于图像级异常检测和文本推理,而像素级定位仍然依赖于外部视觉模块和密集注释。在这项工作中,我们激活 MLLM 的内在推理潜力,仅从图像级监督执行异常检测、像素级定位和可解释推理,无需任何辅助组件或像素级标签。具体来说,我们提出推理驱动的异常定位(ReAL),它从自回归推理过程中提取与异常相关的标记,并聚合它们的注意力响应以生成像素级异常图。我们进一步引入了一致性引导推理优化(CGRO)模块,该模块利用强化学习将推理标记与视觉注意力保持一致,从而实现更连贯的推理和准确的异常定位。对四个公共基准的广泛实验表明,我们的方法显着提高了异常检测、定位和可解释性。值得注意的是,尽管仅依赖于图像级监督,但我们的方法实现了与在密集像素级监督下训练的基于 MLLM 的方法相媲美的性能。代码可在 https://github.com/YizhouJin313/ReADL 获取。