论文
作为语义原型的监督分类头:通过权重回收解锁视觉语言对齐
Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling
摘要
视觉语言模型 (VLM) 通过将图像和文本映射到共享空间,擅长执行零样本分类和跨模式检索等任务,但这需要使用大量配对数据集进行昂贵的端到端训练。当前的事后对齐方法通过轻量级映射连接预训练的编码器来降低计算成本,但仍然需要大量的配对数据。在这项工作中,我们研究了将预训练视觉模型的分类头重新用作语义原型的潜力。这些权重的回收(通常在预训练后被丢弃)解锁了两种不同的功能:它通过使用权重作为语义锚来实现零样本对齐,并通过将这些原型与真实的图像文本对混合来充当强大的数据增强策略。我们证明,将我们的方法与几种最先进的事后对齐技术相结合,可以持续提高跨模式检索、零样本和少样本分类任务的准确性。