论文

闭开放工业检测场景的统一:新大规模基准

Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

模型评测基准与评测资源

摘要

大规模视觉语言模型(LVLM)在自然视觉任务中取得了显着的成功,但由于两个基本限制,它们在工业缺陷检测中的应用仍然具有挑战性:(i)覆盖多个领域的不同缺陷类别的大规模工业数据集的稀缺性,以及(ii)对手动提示(点、框、掩模)的依赖,这些提示引入了主观噪声,并且缺乏用于细粒度理解的文本视觉交互。为了应对这些挑战,我们引入了大规模多模态工业开闭基准 (MMIOC-1M),其中包含超过 100 万个样本,涉及 14的超级类别、29的工业场景和 351的缺陷子类别。据我们所知,MMIOC-1M是第一个同时支持开放词汇和封闭集工业检测的统一最大基准,为工业场景中的LVLM提供了有价值的预训练数据。此外,我们提出了一种精致的文本视觉提示网络(RTVPNet),它融合了三个关键创新:(1)专家辅助的域投影机制,使通用视觉模型能够快速适应工业领域;(2)基于能量的稀疏采样策略,无需人工干预即可自动生成精致的视觉提示;(3)双向文本视觉交互模块,增强跨模式语义对齐和理解。大量实验表明,RTVPNet 在 MMIOC-1M、LVIS 和 COCO 基准上实现了最先进的性能,同时保持了计算效率。数据集和代码可在 https://github.com/hellozzk/MMIO 获取。

闭开放工业检测场景的统一:新大规模基准:论文配图
图 1:(a)传统提示方法与我们的方法之间的比较。我们的方法解决了传统手动提示的主观性,并引入文本来进一步细化语义。(b)工业场景与自然场景有很大不同。在自然场景中训练的模型很难推广到工业场景中。