论文

同策略 扩散模型中的自 蒸馏

On-Policy Self-Distillation in Diffusion Models

模型训练强化学习

摘要

强化学习可以使扩散模型与人类偏好和特定任务目标保持一致,但端点奖励并没有指定中间去噪预测应如何改变。我们引入 DiffusionOPSD 作为 同策略 自 蒸馏 框架,它将图像级奖励指导转换为明确的目标,以便在采样查询时进行干净的输出预测。在每次外部迭代中,冻结的行为策略都会生成轨迹并提供查询状态和锚点。奖励梯度在每个锚点周围构造有界的正目标和负目标。在指数移动平均更新刷新行为策略之前,可训练策略通过有限拟合作为独立监督来拟合这些目标。这种设置让我们可以分别测量目标构建和有限实现。受控的相同查询实验表明,在单次拟合更新后,较大的目标构建增益不一定会转化为较大的实现增益。在 SD 3.5-M 和逐步蒸馏的 Z-Image-Turbo 中,我们的方法在两个骨干网和 10 个评估者的 20 个奖励匹配设置中的 19 个中获得了最佳的最终保留分数。与最强的竞争方法相比,它的性能提高了 44.0%,并且相对于 DiffusionNFT,训练 GPU 时间在 SD 3.5-M 上减少了 40%,在 Z-Image-Turbo 上减少了 63%。这些结果支持 同策略 self-蒸馏 作为一种有效且可分析的扩散 后训练 方法,通过将图像级奖励指导转换为明确且不断刷新的中间监督,从而开辟一条通向更高效和可诊断对齐的道路。