论文

PRiSM:少样本 VLM 的原型正则化

PRiSM: Prototype Regularization for Few-Shot VLMs

模型训练参数高效训练

摘要

无需训练 少样本自适应方法最近在视觉语言模型(VLM)的背景下获得了极大的关注。然而,当前的基准依赖于对适应数据统计的强有力的假设,例如类别平衡。我们质疑这些简化的假设,并引入一个更现实的基准,通过狄利克雷采样改变类平衡水平和少样本任务中的有效类数量。令人惊讶的是,在我们的设置下,我们观察到最先进方法的性能大幅下降,当标记样本数量增加时更是如此。为了缓解这个问题,我们引入了 PRiSM,这是一种类原型正则化,可以作为即插即用模块部署在任何现有基线方法之上,从而显着提高性能。我们的方法优化了一种新颖的多项损失,其中包括最大化类间成对距离的正则化器,以及促进支持特征对齐和对基线原型的保真度的附加项。此外,我们为我们的目标引入了一个有效且计算高效的块 Majorize-Minimize 优化器。更具体地说,我们推导了一个有效的分块 Lipschitz 常数(即 Hessian 谱范数的界限),它可以通过 Gershgorin 圆定理有效地计算。大量实验表明,PRiSM 改进了多个 无需训练 基线,在处理严重的类别不平衡和大量类别时具有巨大收益。