论文
更大的文本编码器可能会损害 CLIP 零样本性能
Bigger Text Encoders Can Hurt CLIP Zero-Shot Performance
摘要
对比语言图像预训练 (CLIP) 是许多机器学习应用程序的构建块。缩放法则指导了大规模训练的资源分配,但之前的工作将 CLIP 模型的总大小视为单个变量,而没有探索编码器之间的容量分配如何影响下游性能。在这里,我们训练了具有不同视觉和文本编码器大小的多个 CLIP 模型,结果表明,对于大多数视觉编码器来说,存在一个最佳文本编码器大小,超过该大小,即使总参数数量增加,零样本性能也会下降。利用这种行为可以产生高效的配置,与标准 ViT-B/16 架构的零样本性能相匹配,并且参数减少多达 55%。我们进一步表明,这种退化源于超大文本编码器引起的过度拟合,并且使用特定于模态的权重衰减系数不仅可以恢复而且还可以提高所有退化配置的性能。几何分析揭示了一种权衡,其中缩放文本编码器可以提高嵌入均匀性,但会恶化跨模式对齐;我们进一步表明,这些指标可以预测零样本性能。我们希望这些发现能够激发 CLIP 架构和训练方法来抵消这种退化,这是可靠、高效地扩展 CLIP 的先决条件。