论文
CARPRT:黑盒视觉语言模型的类感知零样本提示重新加权
CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models
摘要
预训练的视觉语言模型 (VLM) 通过计算图像和文本描述之间的相似性分数来实现零样本图像分类,通常通过将类标签(例如“猫”)插入到提示(例如“a 的照片”)中来形成。由于给定图像类对的分数对提示的选择很敏感,因此现有研究使用加权向量来集成多个提示,以汇总不同提示的分数。然而,在当前的策略中,分配给每个提示的权重向量在所有类别之间共享,隐含地假设提示有条件地独立于类别,这在实践中通常不成立,因为像“鸟瞰图”这样的提示可能适合“机场”,但不适合“苹果”。为了解决这个问题,我们提出了类感知零样本提示重新加权(CARPRT)。该评分方案通过以 无需训练 方式捕获不同提示的类特定相关性来调整每个类标签的权重向量。对于每个类标签和每个可用的提示,我们通过对给定提示下预测到该类的图像的图像文本相关性得分进行平均来量化其特定于类的相关性。然后将这些估计值标准化以得出特定于类别的权重。对标准图像分类基准的评估表明,CARPRT 优于现有的与类无关的重新加权方法,这证实了建模提示类依赖性对于有效的零样本预测以及依赖于提示集成的更广泛的基于 VLM 的应用程序设置至关重要。我们的代码可在 https://github.com/tmlr-group/CARPRT 获取。