论文

IndusAgent:使用代理工具强化开放词汇工业异常检测

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

智能体系统Agent 工具调用

摘要

多模态 大语言模型 (MLLM) 在桥接视觉感知和文本推理方面表现出了卓越的能力,从而实现了跨不同工业场景的零样本理解。然而,它们在开放词汇工业异常检测(IAD)中的表现通常受到领域错位推理和幻觉结构推理的限制。为了应对这些挑战,我们提出了 \textbf{IndusAgent},这是一种用于开放词汇 IAD 的工具增强代理框架。具体来说,我们首先构建 \textbf{Indus-CoT},这是一个集成了全局视觉观察、高分辨率局部补丁和专家常态先验的结构化数据集,为严格的工业检查轨迹模型 微调 提供监督。在此基础上,IndusAgent 动态编排了一组外部工具,包括动态区域裁剪、高频特征增强和事先检索,从而使代理能够主动解决视觉模糊性并理清细微的异常情况。此外,我们引入了门控强化学习目标,该目标联合优化异常分类、定位准确性、异常类型推理和高效工具使用,确保仅在有益时才调用工具。对 MVTec-AD、VisA、MPDD、DTD 和 SDD 等五个工业异常基准的广泛评估表明,IndusAgent 在所有现有方法中实现了最先进的零样本性能,验证了我们的稳健性和泛化能力。