论文

视觉语言数据集 蒸馏 的多模态分布匹配

Multimodal Distribution Matching for Vision-Language Dataset Distillation

模型训练合成数据

摘要

数据集 蒸馏 将大型训练集压缩为紧凑的合成数据集,同时保留下游性能。随着现代系统越来越多地在成对的视觉语言输入上运行,多模态 蒸馏 必须在紧张的计算和内存预算下保持表示质量和跨模态对齐,但先前的方法通常需要大量计算并忽略它们的相关性。为了解决这个问题,我们提出了多模态分布匹配(MDM),这是一种用于高效且可泛化的多模态 蒸馏 的几何感知框架。具体来说,MDM 在数据、模型和损失级别集成了互补组件。在数据级别,它通过从联合嵌入空间中的簇中采样来初始化合成图像文本对。在模型层面,它根据与预训练锚点的角度偏差在权重空间中插入独立微调的模型,从而形成混合教师。在损失级别,它使用几何感知匹配目标来匹配单位超球面上的联合分布,该目标利用跨模式一致性和差异方向上的联合特征以及对称对比学习。在跨架构评估的图像文本检索基准中,MDM 生成紧凑的合成集,保留多模态语义,大幅降低 蒸馏 成本,并在跨架构中保持稳健性。