论文
DifferAD-R1:采用多模态大语言模型的差异引导工业异常定位
DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models
摘要
工业异常定位旨在准确识别和定位工业产品中的异常区域,解决在现实场景中检测未见缺陷类别的关键挑战。传统的闭集方法通常存在跨场景泛化能力差的问题,而现有的基于多模态 大语言模型 (MLLM) 的方法面临两个核心限制:它们要么采用与本地化实际需求不相符的 QA 式范式,要么依赖组相对策略优化 (GRPO) 等标准优化技术,无法针对细微缺陷提供有效的学习信号。为了解决这些问题,本文提出了 DifferAD-R1,这是一种专为工业异常定位而定制的 MLLM 增强强化学习框架。我们设计了一种差异引导双图像范式,将定位任务重新表述为一次性差异定位问题,以有效地探索跨场景异常。针对难以检测的异常情况开发了双重一致性定位奖励,增强了优化的稳定性和鲁棒性。此外,我们将难度感知策略与自适应重新加权和分组重采样相结合,以优先考虑具有挑战性的实例的学习。为了便于在现实工业环境中进行评估,我们构建了 AD-DualDiff 数据集,其中包含 20 个类别的 13K 配对图像。实验结果表明,与 Qwen3-VL(235B 参数)等大规模模型相比,DifferADR1 显着优于现有基线,并实现了具有竞争力的性能。我们的代码公开于:https://github.com/Rong2026/work-1。