论文
重新思考 同策略 扩散中的无分类器指导 蒸馏
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
摘要
同策略 蒸馏 (OPD) 通过沿着当前学生生成的轨迹查询教师来调整扩散模型,但它在无分类器指导 (CFG)(现代扩散系统的默认组件)下应如何表现仍然知之甚少。现有的 OPD 方法自然地将速度匹配扩展到 CFG 组合预测,直接匹配教师和学生引导的速度。我们表明,该目标在分支级别上未被充分识别:正分支错误和负分支错误可以在引导预测中进行补偿。通过两个对比案例,我们发现朴素匹配在共享负条件下仍然有效,其中两个分支错误共同减少。然而,当模型的原生 CFG 模式在教师的负分支中保留学生无法获得的特权信息时,这种联合归约就会失效,并且组合目标会引发对抗性分支错误动态,减少正分支错误,同时增加负分支错误。我们将这种故障模式称为负分支不对称 (NBA)。为了解决 NBA 问题,我们引入了正方向匹配 (PDM),这是一种分支感知 OPD 目标,它分别约束正预测和 CFG 条件方向。我们将 PDM 应用于从稠密到稀疏的视频控制,其中朴素引导匹配对推理引导尺度高度敏感,而分支感知监督可以实现更稳健、更有效的知识转移。