论文

通过结构化提示重新参数化重新编程视觉语言模型

Reprogramming Vision-Language Models via Structured Prompt Reparameterization

模型训练参数高效训练

摘要

视觉重新编程通过修改输入和输出接口,同时保持主干固定,使预训练模型适应下游任务。在视觉语言模型中,现有方法主要依赖于类内提示聚合,并且没有显式地建模类之间的关系。然而,细粒度的类别通常在文本嵌入空间中表现出高度重叠的属性描述和强的类间相关性,其中区分线索位于微妙的低方差分量中。我们提出了重新参数化类间视觉重编程(RVP),这是一种结构化框架,可聚合每个类中的多个文本提示并跨类应用残差校正。我们还表明,具有与输入无关的线性输出聚合的基于 CLIP 的视觉重编程可以表示为从冻结图像嵌入到下游logits的线性映射,并使用此视图来设计结构化重参数化,该结构重参数化可以对共享语义组件和特定于类的差异进行建模。 RVP 仅使用单个视觉提示,并且可以在推理时重新参数化为冻结主干,然后是线性分类器,从而产生几乎为零的计算开销。在 11 个少样本分类基准和 4 个 CLIP 主干中,RVP 持续改进了之前的视觉重编程方法,具有相当或更好的推理效率。