论文
[CLS] 还不够:通过补丁级推理和自适应聚合进行多标签识别
[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation
摘要
CLIP 等视觉语言模型通过将图像与文本概念对齐来表现出强大的零样本识别能力,但它们在多个对象共存的多标签识别上通常表现不佳。一个关键瓶颈是,[CLS] 词元作为单一的全局视觉表示,不足以忠实地编码具有不同尺度、上下文和共现模式的不同目标。为了解决这个限制,我们提出了一种新的多标签图像识别框架,称为 PIAA,它将预测制定为补丁级推理,然后是自适应聚合。具体来说,我们首先从两个互补的角度增强补丁预测:(i)减轻视觉编码器中的语义纠缠以获得更具辨别力的补丁表示,以及(ii)学习无监督视觉分类器以缩小视觉语言模态差距。然后,我们引入一个自适应聚合模块,将补丁级分数合并到最终的多标签预测中。值得注意的是,整个管道完全是 无需训练,不需要梯度更新或参数 微调。实验表明,我们的方法以最少的额外计算实现了强大的改进,在具有挑战性的 NUS-WIDE 基准上,mAP 比代表性基线提高了 6% 以上。代码可在 https://github.com/akang-wang/PIAA 获取。