论文
MLLMCLIP:用于鲁棒视觉语言表示的 MLLM 功能级 蒸馏
MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations
摘要
像 CLIP 这样的预训练视觉语言模型在零样本识别方面表现出色,但在组合性方面常常失败,特别是属性-对象和关系结构。最近的研究通过使用 大语言模型 和文本到图像模型级联生成的合成硬底片来增强训练,从而缓解了这个问题,这会产生大量的管道开销。相反,我们提出了 MLLMCLIP,这是一种异构 蒸馏 框架,可将多模态知识直接从生成式多模态 大语言模型 (MLLM) 教师转移到有辨别力的 CLIP 学生中,完全绕过合成数据。为了弥合两种范式之间的架构不匹配,我们引入了基于注意力的每层词元选择和基于 CKA 的 蒸馏 损失。与之前的 CLIP 增强方法相比,MLLMCLIP 实现了最先进的构图准确性,同时在标准零样本分类和图像文本检索方面提供了一致的增益,这表明特征级 蒸馏 增强了构图和通用视觉语言表示能力。