论文
自监督表示引导生成数据集 蒸馏
Self-Supervised Representation-Guided Generative Dataset Distillation
摘要
数据集 蒸馏 将大型训练集压缩为紧凑的合成集,同时保留其下游实用性。大多数现有方法都针对随机初始化的网络,而现代视觉系统通常采用带有轻量级模块的冻结预训练编码器。因此,蒸馏样本应保留预训练表示空间的判别几何形状,而现有的生成目标并未明确考虑这一点。我们提出了自监督表示引导生成数据集 蒸馏 (SRG),这是一个将 SSL 几何转化为扩散指导的框架。具体来说,SRG 从真实图像 SSL 表示构建类原型,并通过三个 SSL 空间目标进行指导,以进行原型对齐、类间区分和类内分配。在扩散采样过程中,它采用分阶段指导策略:早期去噪锚定到真实图像的潜在特征,其 SSL 表示最接近指定的原型,而后期去噪则由 SSL 空间目标引导。这种划分保留了生成先验提供的视觉真实感,同时逐渐将样本转向 SSL 表示空间的代表性和类别区分区域。 SRG 在多个数据集和 IPC 设置中始终优于评估的生成基线。跨编码器评估进一步表明跨预训练表示空间的传输。这些结果证明了使用预训练 SSL 模型对数据集 蒸馏 进行表示引导生成的有效性。