论文

使用分层控制词汇表了解历史照片集中的 CLIP 检索失败

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

模型评测模型行为与机制分析

摘要

GLAM 机构(画廊、图书馆、档案馆和博物馆)使用受控词汇(例如艺术和建筑同义词库 (AAT))组织图像访问。对于这些环境中基于内容的图像检索,越来越多地使用 CLIP 等视觉语言模型,但它们的性能各不相同。众所周知,这种变化与概念抽象和概念频率等度量有关。然而,之前的工作还没有从 GLAM 专业人员已经使用的 AAT 等词汇表的结构特性方面解释这种变化。 AAT 将概念分为广泛的方面(对象、活动、代理等),并在其中按层次结构排列术语。在本文中,我们询问两个结构属性(根面类型和层次结构深度)是否可以解释 CLIP 检索在何处成功和失败,以及 微调 在何处有帮助。在用 AAT 术语注释的三个历史摄影集中,我们检查了视觉连贯性(术语的照片是否聚集在 CLIP 的嵌入空间中)、文本图像对齐(其标签是否靠近该聚集)以及将两者混为一谈的标准检索措施。我们发现视觉连贯性和文本图像对齐在各个术语之间几乎不相关,并且共同区分不同的故障模式。照片紧密聚集但标签远离簇的术语在每个集合中检索都很差,在三个集合中的两个中甚至比在这两个指标上都失败的术语更糟糕。我们还表明,虽然检索指标与任一结构属性都没有显着相关,但根面类型确实显着区分了具有不同视觉连贯性的类别。最后,我们发现 微调 整体上改善了检索,但其收益有利于层次结构中较浅的术语,其中文本图像对齐改善最多,超出了概念频率所解释的范围。