论文

PCLM:通过原型对比度和局部放大,使用冻结 CLIP 进行小目标定位

PCLM: Small-target localization with frozen CLIP via prototype contrast and local magnification

应用与实践视觉感知与空间理解

摘要

小目标在视觉语言编码器中占据很少的块,因此空间特征通常将对象外观与周围内容混合在一起。我们提出了原型对比度和局部放大(PCLM),这是一种使用冻结 CLIP 编码器的支持条件定位方法。每类五个蒙版支持图像通过同等权重的区域特征定义前景和背景原型。它们的差异为查询补丁提供了共享的评分方向,明确地将目标证据与演示的背景进行比较。九个重叠的查询窗口被独立放大和编码,以更密集地采样小目标。重投影和覆盖率平均将它们的分数组合成连续的定位图。无论支持数量如何,类方向都会占用 2 KiB,并且在具有映射类别的数据集之间传输不变。在来自 VOC、COCO、ADE20K 和 Oxford-IIIT Pets 的 5,047 个小目标查询中,PCLM 实现了比我们的评估协议下每个数据集上每个评估的文本条件定位基线更高的平均像素 AP。相对于最强场景数据集基线的增益范围为 5.63 到 13.23 个百分点。在可比较的测量延迟下,局部放大将场景小目标 AP 比整个画布放大提高了 4.51 至 5.68 点。析因实验表明,原型对比度增加了局部观察的好处,包括在匹配的图像坐标过滤下。支持预算实验表明,额外的示例可以改进类别估计,而不会增加表示大小或查询时间评分成本。

PCLM:通过原型对比度和局部放大,使用冻结 CLIP 进行小目标定位的原论文方法或结果图
图 4:选定的成功 ADE20K 和 Pets 示例。 PCLM 使用来自银行 11 的五个屏蔽支持;参考文献使用类文本。所有本地地图都使用九个窗口,在投影和覆盖率平均之前保留每种方法的每次视图分数。绿色轮廓标记目标,灰色阴影标记忽略像素。显示使用每张地图第 1-99 个百分位数缩放; AP 使用已知像素上的未缩放分数。