论文
节食蒸馏:通过可学习数据修剪实现高效 知识蒸馏
Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning
摘要
知识蒸馏 (KD) 广泛用于获取紧凑模型,以便在资源受限的环境中进行高效推理。然而,蒸馏 过程本身的计算开销经常被忽视,这就提出了一个问题:是否可以通过数据修剪以更少的数据和更少的计算来获得更好的学生模型。然而,现有的数据修剪方法并不是为 KD 设计的:有些方法引入了大量的开销,例如通过再训练获得训练动态,而其他方法则依赖于启发式选择规则,而这些规则无法捕获 KD 实际需要的内容,通常会导致子集次优。为了解决这些问题,我们提出了 IF-Beta,这是一种有效的数据修剪框架,它将影响函数与可学习的采样策略相结合。根据经验,我们首先证明影响函数可以作为 KD 设置中样本影响的有效且高效的估计器,其中只有经过预先训练的教师可用。在此基础上,我们的采样策略专门由 Beta 分布参数化,其高度灵活的双参数族允许策略适应不同的修剪机制,而不是受限于固定的启发式形式。接下来,我们将 KD 剪枝制定为通过双层目标优化该策略,其中内循环在具有 KD 对齐目标的教师特征空间中运行,从而实现快速代理训练,而外循环则更新策略参数以最大化 蒸馏 性能。这种设计确保 IF-Beta 的计算效率高,并且本质上与 KD 的目标保持一致。 CIFAR-10/100 和 ImageNet 上的大量实验表明,IF-Beta 在各种剪枝率上始终优于其他基线。值得注意的是,IF-Beta 使接受较少数据和计算训练的学生能够超越在完整数据集上提取的学生的表现。