论文
CLAY:视觉语言嵌入空间中的条件视觉相似性调制
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
摘要
人类对视觉相似性的感知本质上是自适应的和主观的,取决于用户的兴趣和焦点。然而,大多数图像检索系统无法体现这种灵活性,而是依赖于无法同时包含多个条件的固定的整体度量。为了解决这个问题,我们提出了 CLAY,一种自适应相似性计算方法,它将预训练视觉语言模型(VLM)的嵌入空间重新构建为文本条件相似性空间,而无需额外训练。这种设计将文本调节过程和视觉特征提取分开,允许通过固定视觉嵌入进行高效和多条件检索。我们还构建了一个综合评估数据集 CLAY-EVAL,用于在不同条件检索设置下进行综合评估。在标准数据集和我们提出的数据集上的实验表明,与之前的作品相比,CLAY 实现了较高的检索精度和显着的计算效率。