论文
用于预训练视觉模型的封闭式线性探针数据集 蒸馏
Closed-Form Linear-Probe Dataset Distillation for Pre-trained Vision Models
摘要
数据集 蒸馏 将大型训练集压缩为小型合成集,保留下游训练实用性。虽然大多数现有方法都是从头开始训练网络,但现代视觉迁移学习通常使用冻结的预训练编码器,然后使用轻量级线性探测。用于此设置的现有 蒸馏 方法要么通过基于轨迹的梯度匹配展开迭代线性探针更新,要么依赖最初为使用神经切线核 (NTK) 近似从头开始训练而设计的封闭形式公式。这两种路线都没有利用这样一个事实:冻结特征线性探测承认由预训练特征本身直接确定的封闭形式解决方案,没有无限宽度近似,也没有内环轨迹。我们提出了闭式线性探针数据集 蒸馏 (CLP-DD),这是一种双层公式,可使用样本空间核岭求解器计算由合成集引起的线性探针。然后通过温度缩放的 softmax 交叉熵评估真实特征上的诱导分类器来更新合成图像,其中分类器列充当特征空间中的学习类锚点。我们进一步表明,外部目标的选择是决定性的:将封闭式内部求解器与标准 MSE 外部损失配对,其性能明显低于基于轨迹的方法,而判别性外部损失则弥补了大部分差距。在具有四个预训练主干的 ImageNet-100 上,CLP-DD 比不使用 DSA 的 LGM 有了显着的改进,并且以计算成本的一小部分接近使用 DSA 的 LGM。在 ImageNet-1K 上,CLP-DD 在四个主干网中的三个上匹配或超过了带有 DSA 的 LGM,同时运行速度快了大约 14 倍,并且使用的 GPU 内存不到八分之一。