论文
无配对数据的跨模态 知识蒸馏:理论基础和算法
Cross-Modal Knowledge Distillation without Paired Data: Theoretical Foundation and Algorithm
摘要
跨模态 知识蒸馏 (CMKD) 研究在一种类型的数据(例如图像)上训练的(大型)教师模型如何指导基于另一种类型的数据(例如文本/音频)构建的(较小的)学生模型。现有的 CMKD 方法通常需要具有对齐语义的配对多模态数据,但获得此类配对数据通常成本高昂且不切实际。为了缓解这一限制,我们开发了一个新的 CMKD 框架,用于应对配对数据不可用的更具挑战性的环境。特别是,我们在教师和学生模型之间建立了跨模式分布关系,揭示了控制有效 蒸馏 的两个基本量:特征对齐和标签对齐。这些量分别表征了表示和预测分布级别上模态之间的语义差异。受这种见解的启发,我们提出了一个具有理论保证的原则框架,通过对齐分布而不是单个样本来实现有效的跨模态 知识蒸馏。跨多种多模式基准的广泛实验表明,我们的框架在未配对和配对数据设置中都非常有效,比之前的工作有了显着改进。