论文
从弱到强 知识蒸馏 加速视觉学习
Weak-to-Strong Knowledge Distillation Accelerates Visual Learning
摘要
大规模视觉学习越来越受到训练成本的限制。现有的 知识蒸馏 方法从较强的教师转移到较弱的学生,以进行压缩或最终准确性的提高。我们转而研究蒸馏,以加速培养优秀学生。我们提出了一种通用的即插即用配方,可以冻结较弱的教师,仅在早期训练中应用 蒸馏,并在学生达到并超过教师水平的表现后将其关闭。对于 ImageNet 和 CIFAR 分类,该策略更早地达到目标阈值,按 epoch 测得的加速高达 4.8 倍。我们确认该方法可以推广到其他任务,并在 COCO 数据集上报告目标检测的 1.7 倍纪元加速,以及在 CIFAR-10 数据集上进行扩散生成的早期目标-FID 交叉的 2.5 倍(按步骤测量)。这些发现验证了我们的方法作为视觉学习的通用加速机制。