论文
视觉语言模型的 AdaBoosting 文本提示
AdaBoosting Text Prompts for Vision-Language Models
摘要
预训练视觉语言模型 (VLM) 的分类准确性取决于文本提示的质量。手工制作的模板和 大语言模型 (LLM) 生成的描述不仅使预测更易于解释,而且还可以跨异构 VLM 重复使用相同的提示。最近的作品使用少量标记图像构建了适应任务的文本提示。然而,现有的少镜头文本提示方法并没有明确关注提示构建过程中错误分类的示例,即使有更多镜头可用,也只能实现微小的改进。为了充分利用小样本监督,我们提出了文本提示提升(TPB),这是一种受 AdaBoost 启发的框架,它将每个基于文本提示的分类器视为弱学习器,并通过明确针对困难的、错误分类的示例,将它们顺序聚合成一个强大的集合。大量实验表明,TPB 在文本空间中保留了任务固有的、与模型无关的线索,从而实现了稳健的跨模型传输。在 11 个分类基准中,TPB 提高了源模型的准确性,并在转移到更大、功能更强大的 VLM 时保留镜头驱动的增益,而现有方法很难维持这种改进。