论文

MMR-AD:用于使用多模态进行一般异常检测基准测试的大规模多模态数据集 大语言模型

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

模型评测基准与评测资源

摘要

在工业异常检测的进展中,一般异常检测(GAD)是一个新兴趋势,也是最终目标。与传统的单类和多类 AD 不同,通用 AD 旨在训练通用 AD 模型,该模型可以直接检测各种新类中的异常,而无需对目标数据进行任何重新训练或 微调。最近,多模态 大语言模型 (MLLM) 凭借其革命性的视觉理解和语言推理能力,在实现一般异常检测方面显示出了巨大的前景。然而,MLLM 的通用 AD 能力仍未得到充分开发,原因是:(1)MLLM 是根据来自 Web 的大量数据进行预训练的,这些数据与 AD 场景中的数据仍然存在显着差距。此外,预训练期间的图像文本对也不是专门用于 AD 任务的。 (2) 目前主流的AD数据集是基于图像的,尚不适合后训练 MLLM。为了促进基于 MLLM 的通用 AD 研究,我们提出了 MMR-AD,它是用于训练和评估基于 MLLM 的 AD 模型的综合基准。通过 MMR-AD,我们发现当前 SOTA 通用 MLLM 的 AD 性能仍然远远落后于工业要求。基于MMR-AD,我们还提出了一个基线模型Anomaly-R1,它是一个基于推理的AD模型,从MMR-AD中的CoT数据中学习,并通过强化学习进一步增强。大量实验表明,我们的 Anomaly-R1 在异常检测和定位方面比通用 MLLM 取得了显着的改进。