论文
D-OPSD:同策略 Self-蒸馏,用于连续调整逐步蒸馏扩散模型
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
摘要
高性能图像生成模型的前景目前正在从低效的多步骤模型转向高效的少步骤模型(例如 Z-Image-Turbo 和 FLUX.2-klein)。然而,这些模型对直接连续监督 微调 提出了重大挑战。例如,应用常用的 微调 技术会损害其固有的少步推理能力。为了解决这个问题,我们提出了 D-OPSD,这是一种用于逐步蒸馏扩散模型的新颖训练范例,可以在监督 微调 期间实现 同策略 学习。我们首先发现,LLM/VLM 作为编码器的现代扩散模型可以继承其编码器的上下文功能。这使我们能够将训练制定为 同策略 自 蒸馏 过程。具体来说,在训练过程中,我们让模型在不同的上下文中同时充当教师和学生,其中学生仅以文本特征为条件,而教师以文本提示和目标图像的多模态特征为条件。训练最小化了学生自己的部署的两个预测分布。通过在模型自身的轨迹上并在其自身的监督下进行优化,D-OPSD 使模型能够学习新的概念、风格等,而无需牺牲原有的几步能力。