论文
CLIP-RD:用于高效 CLIP 知识蒸馏 的关系 蒸馏
CLIP-RD: Relational Distillation for Efficient CLIP Knowledge Distillation
摘要
对比语言图像 预训练 (CLIP) 展示了强大的零样本泛化能力,但由于大量的计算和内存成本,需要将 蒸馏 转化为轻量级模型。现有的关系目标没有明确地模拟教师和学生嵌入之间的多向关系,可能导致几何关系受到不充分的约束。这可能会破坏对零样本迁移很重要的模态间隙结构。为了解决这些限制,我们提出了一个关系型 蒸馏 框架 CLIP-RD,它引入了两种关系方法:垂直关系 蒸馏 (VRD) 和交叉关系 蒸馏 (XRD)。 VRD 对齐师生模内相似性分布,以在图像和文本嵌入之间强制执行一致的 蒸馏 强度。同时,XRD 对齐教师-图像-学生-文本和教师-文本-学生-图像相似性分布,以施加双向跨模态对称性。通过对这些多向关系结构进行联合建模,CLIP-RD 将学生的嵌入几何图形更忠实地与教师的对齐,比 CLIP-KD 提高了 1.8%p。这种性能改进在不同的架构、教师规模、检索任务、下游任务和损坏设置中得以维持,而额外的训练时间开销可以忽略不计。