论文
属性应该来自图像,而不是类名:视觉语言模型的分布条件属性选择
Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models
摘要
可解释的零样本分类的流行途径要求 大语言模型 (LLM) 描述每个类名称,并使用生成的描述符提示 CLIP。我们表明,这些描述符本身几乎没有视觉证据:从提示中删除类名会使 ImageNet 准确率从 59.5% 下降到 15.5%。诊断结果是,描述符以标签而不是图像为条件,因此它们概括地描述了概念,并在数据发生变化时准确地误导; LLM 坚持认为草莓是红色的,但 ImageNet-Sketch 中的每个草莓都是无色的线条画。因此,我们从目标图像集合中选择属性:我们针对 CLIP 联合嵌入空间中的图像对大型属性池进行评分,并保留每个类别得分最高的属性。通过这种方式选择,无类名属性提示在 ImageNet 上达到 23.8%(而 LLM 描述符为 15.5%),增益保持在四个移位的 ImageNet 变体上,并且从 LLM 自己的池中重新选择将选择机制隔离为原因。对于每个类一张图像,所选属性的性能比提示调整方法 CoOp 高出 3 个点,同时拟合时间不到 1 分钟(而不是 14 小时),并且没有学习到的软提示来模糊决策。由于属性集是由数据选择的,因此它兼作数据集的可读摘要,我们用它来描述单词的分布变化。我们的代码和结果可以在我们的项目页面上找到:https://gare-cmu.github.io/AttributeSelect/