论文
所有视觉标记都同等重要吗?用于视觉语言检索的对象证据保留词元合并
Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
摘要
多向量视觉语言检索通过最大相似性后期交互保留细粒度的视觉证据,但密集的图像侧标记使得存储和评分成本高昂。现有的词元压缩方法降低了这种成本,但它们可以删除或折叠未来查询词元可能需要选择的对象级和区域级证据。我们提出了 SaMer,一个对象感知的词元合并框架,它将图像侧后投影器词元压缩为 $K$ 代表质心,同时保留原始的后期交互界面。 SaMer 仅在训练期间使用对象注释作为合并,以阻止跨实例混合,在推理时不需要 真值 边界框或检测器,并且仅采用具有冻结视觉和语言主干的共享投影层。当 $K=64$ 时,SaMer 删除了超过 93% 的图像端词元,并将 ColPali 存储减少了 $16.09\times$,同时改进了 Flickr30K 和 MSCOCO 上的 R@1。这些收益的产生是因为对象感知合并保留了查询可选择的对象证据,而修剪或仅功能池可以删除或崩溃。 SaMer 的性能还优于压缩基线,并显示出更强的短语级视觉定位,这表明高效的多向量检索不仅取决于减少标记数量,还取决于保留未来查询标记需要选择的证据。