混合比不在于性能:诊断原型混合以实现视觉语言模型的小样本适应
The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models
摘要
许多用于视觉语言模型的少样本适应方法使用零样本文本原型和 K 个标记图像特征的平均值的凸组合进行分类,并且通常在测试集本身上对保留的标签进行常规调整的单个混合比率。我们询问家庭自身的偏差-方差理由会带来什么:正确的比率是多少,是否可以在没有验证数据的情况下进行估计,以及是否找到了绩效所在?首先,比率最小化原型均方误差具有闭合形式,其支持集插件正是向文本原型收缩的正部分James-Stein系数。在 4,800 个单元(10 个数据集、5 个骨干网,包括 SigLIP、5 个射击计数、5 个种子、4 个提示层)中,这个理论上的最佳比率是对错误数量的可靠估计:在定义它的 950 个主层单元上,它落后于测试集预言机比率 8.5 个点。它在 1 附近饱和,丢弃了最近类均值分类器的先验文本,因为它视为偏差的文本-图像原型距离的 78% 是与类无关的偏移量,arg max 很大程度上取消了该偏移量。我们证明了这一机制,并通过反事实将其造成的损害份额限制在 26%。其次,仅在支持集上留一法将比率落在预言混合的 0.9 个点以内,因此无需验证数据即可估计。第三,免验证线性探针甚至击败了预言机调整的混合:平均 CLAP +1.9 点,LP++ +1.5,并且在 K >= 4 时,所有四个免验证基线都位于预言机之上,线性探针的边缘不包括零。这些结果将上限定位在模型类中,而不是超参数中:可以免费将比率设置为接近最佳,但它仍然不是性能所在的位置。代码、缓存特征、每个单元记录:https://huggingface.co/datasets/Liangzhi-Li/clipbench-blending