论文
LARE:用于文本图像检索的低注意力区域编码
LARE: Low-Attention Region Encoding for Text-Image Retrieval
摘要
由于传统视觉编码器的显着性偏差,拥挤场景中的图像检索特别具有挑战性,传统视觉编码器倾向于关注主要对象,而忽略对细粒度检索通常至关重要的低注意力区域。我们提出了 LARE(低注意力区域编码),这是一个对这些被忽视的区域进行显式建模的框架。 LARE 采用双编码策略,并行编码图像的低注意力区域和完整图像,从而获得更加多样化和信息丰富的图像嵌入。为了评估具有挑战性的拥挤场景中的图像检索性能,我们引入了 Dense-Set,这是一个源自 COCO 和 Flickr30K 的具有挑战性的子集。在这个子集中,图像被重新添加标题,以提供对低关注度或以前被忽视的区域的更丰富的描述。该数据集凸显了现有检索模型的局限性,并能够在密集拥挤的场景条件下进行更严格的评估。实验结果表明,所提出的框架通过在共享潜在空间中保留微妙的、非主导的视觉线索来提高检索性能。