论文

Few Shots 文本到图像检索:新的基准数据集和优化方法

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

模型评测基准与评测资源

摘要

预训练的视觉语言模型 (VLM) 擅长多模态任务,通常将图像编码为嵌入向量,以便存储在数据库中并通过近似最近邻搜索 (ANNS) 进行检索。然而,这些模型在组合查询和分布外 (OOD) 图像文本对方面遇到了困难。受人类认知从最小示例中学习的能力的启发,我们通过专门为图像检索设计的小样本学习方法来解决这一性能差距。我们介绍了少样本文本到图像检索 (FSIR) 任务及其随附的基准数据集 FSIR-BD - 第一个通过文本和参考示例明确目标图像检索,重点关注具有挑战性的组合和 OOD 查询。构图部分分为城市场景和自然物种,既有特定的情境,也有鲜明的特色。 FSIR-BD 包含 38,353 个图像和 303 个查询,其中 82% 构成测试语料库(平均每个查询 37 个正例、真值 匹配以及大量硬负例),18% 形成样本正例图像和硬负例图像的少样本参考语料库 (FSR)。此外,我们提出了两种新颖的检索优化方法,利用 FSR 中的单镜头或少数镜头参考示例来提高性能。这两种方法都与任何预先训练的图像编码器兼容,使其适用于现有的大规模环境。我们的实验表明:(1)FSIR-BD 为图像检索提供了一个具有挑战性的基准; (2)根据平均精度(mAP)衡量,我们的优化方法优于现有基线。对 FSIR 优化方法的进一步研究将有助于缩小机器和人类理解水平之间的差距,特别是对于有限示例的组合推理。