论文

与视觉基础模型解耦原型匹配,用于少样本工业物体检测

Decoupled Prototype Matching with Vision Foundation Models for Few-Shot Industrial Object Detection

应用与实践视觉感知与空间理解

摘要

工业对象检测系统通常依赖于大型带注释的数据集,这些数据集的收集成本很高,并且在对象库存频繁变化的工业场景中维护起来也很困难。这项工作解决了此类工业场景中少镜头物体检测的挑战,其中只有有限数量的标记样本可用于新引入的物体。我们提出了一个检测框架,利用视觉基础模型以最少的监督来识别对象。该方法通过提取特征表示,从一小组参考样本中构造类原型。对于推理过程中给定的查询场景,使用分割模型生成对象区域,并使用相似性匹配提取特征嵌入并与类原型进行匹配。我们遵循官方 2D 对象检测评估协议,在 6D 对象姿势估计基准基准的三个已建立的工业数据集上评估检测方法。我们展示了具有竞争力的检测性能,与最先进的 无需训练 检测方法相比,AP 提高了 6.9%。此外,所提出的方法能够仅使用少量参考图像来加载新对象,而不需要任何 CAD 模型或大型注释数据集。这些特性使得该方法非常适合现实世界的工业应用。