论文
STEP-OPD:重新思考 同策略 蒸馏 中扩散模型的输出目标和内部动态
STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models
摘要
同策略 蒸馏 (OPD) 已成为将多个任务专用图像生成模型整合到单个学生中的有效方法。然而,现有的OPD方法主要对学生进行优化以匹配教师的输出速度,使得教师成为优化目标的上限。虽然仅输出级监督会使学生的块式表示进化受到限制,这削弱了必须跨层逐步开发的能力的转移。我们提出了 STEP-OPD,一种用于图像生成的 同策略 蒸馏 框架,它将学生的学习目标扩展到教师之外,并对其内部表示演化引入了明确的约束。我们没有将教师视为最终目标,而是使用每个特定于任务的教师和共享基础模型之间的速度差异作为进一步学习的方向,并将这种差异的缩放版本添加到教师速度中。此外,我们调整学生和教师之间表示变化的方向和幅度,使学生能够了解表示如何跨网络块逐步转换。组合对齐、文本渲染和人类偏好的实验表明,我们的方法持续改进了标准 OPD 方法。特别是,它将 DiffusionOPD 的 GenEval 分数从 0.927 提高到 0.961,同时还改进了 OCR 和所有基于偏好的指标。由此产生的统一学生在所有三个能力组中都超过了相应的单任务教师,这表明输出外推可以实现超越教师的学习。表征变化的调整为学生的内部转变提供了补充指导。