论文

领域内培训足以理解细粒度的工业异常吗?

Is In-Domain Training Enough for Fine-Grained Industrial Anomaly Understanding?

智能体系统模型推理应用与实践判别式推理与决策Agent 协作行业应用

摘要

单一多模态大语言模型 (MLLM) 很难同时在多模态工业异常理解 (MM-IAU) 的检测、定位、描述和推理方面表现出色。我们表明,领域内培训并不能弥补这一差距。在广泛采用的 MM-IAU 基准 MMAD 上,训练有素的专家在缺陷定位方面的准确率最高为 75.5%,而人类专家的准确率为 92.3%,甚至检测异常的准确度甚至低于未经训练的基础模型。同时,不同的 MLLM 具有互补的优势,但在细粒度感知方面也有共同的弱点,因此单独将它们结合起来并不能消除它。因此,我们提出了 SiGMA,这是一个基于空间的多智能体框架,可在异构 MLLM 智能体和专门的视觉缺陷专家之间进行分工。多模态搜索器提供工业知识和正常参考,缺陷专家将查询参考比较转化为校准的异常证据,无标签可靠性控制器通过任务方面的能力和查询级证据质量来权衡每个来源。 SiGMA 平均达到 85.2% MMAD 的准确率比训练有素的最强专家和 Gemini-2.5-Pro 高 4.0%,比人类专家高 1.5%。即使三个代理的参数最多为 9B,它也达到 84.4%,并且新的 MLLM 无需重新训练即可加入。