论文
工业场景零样本学习:新大规模基准、挑战
Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline
摘要
大型视觉语言模型(LVLM)在视觉任务中取得了显着的成功。然而,工业场景和自然场景之间的显着差异使得 LVLM 的应用具有挑战性。现有的 LVLM 依赖于用户提供的提示来分割对象。由于包含不相关的像素,这通常会导致性能不佳。此外,数据的稀缺也使得LVLM在工业场景中的应用仍有待探索。为了填补这一空白,本文提出了一个开放的工业数据集和用于零样本工业缺陷检测的精炼文本视觉提示(RTVP)。首先,本文构建了包含 80K+ 样本的多模态工业开放数据集(MMIO)。 MMIO包含丰富的行业类别,包括6个大类和18个子类。 MMIO是首个用于工业零样本学习的大规模多场景预训练数据集,为未来工业场景中的开放模型提供有价值的训练数据。本文基于MMIO,提供了一种专门针对工业零样本任务的RTVP。 RTVP有两个显着的优点:首先,本文设计了专家引导的大模型域自适应机制,并设计了基于Mobile-SAM的工业零样本方法,增强了工业场景下大模型的泛化能力。其次,RTVP直接从图像自动生成视觉提示,并考虑之前LVLM忽略的文本-视觉提示交互,提高视觉和文本内容的理解。 RTVP 在 MMIO 的零样本和封闭场景中以 42.2% 和 24.7% AP 实现了 SOTA。
