论文
重新思考用于少样本目标检测的基于原型的相似性学习
Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection
摘要
少样本目标检测旨在仅从少数标记示例中检测新的目标类别,从而避免昂贵的大规模注释。最近基于原型的相似性学习方法通过将查询特征与类原型相匹配来实现 无需训练 适应。然而,它们面临两个基本限制:(i)类间相似性边缘崩溃引起的类混淆,以及(ii)用于精确定位的视觉线索不足,因为相似性分数仅捕获类级别的语义亲和力,同时提供有限的空间信息。为了解决这些问题,我们引入了两个互补的组件。文本锚定语义掩码 (TSMa) 利用类级文本特征作为语义锚点,通过视觉和文本特征之间的通道交互来识别语义对齐的通道。通过抑制风格引起的虚假响应并强调类别固有信号,TSMa 扩大了类别间的相似性裕度并减轻了类别混乱。我们进一步提出阶段对齐的分层自回归(SHARe),它将本地化重新表述为分层自回归过程,逐步细化跨多个阶段的边界框。 SHARe 通过将特征抽象级别与回归阶段对齐来利用 ViT 表示的逐层特征:较深层指导早期粗定位,而富含边缘和纹理线索的较浅层在后期细化空间细节。 COCO 上的实验展示了一种新的技术水平,比之前的最佳性能高出 +10.1 nAP,并通过广泛的分析验证了每个组件。该代码可从 https://github.com/VisualScienceLab-KHU/ReSet 获取。