论文
DiffusionOPD:扩散模型中 同策略 蒸馏 的统一视角
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
摘要
强化学习已成为改进基于扩散的文本到图像模型的强大工具,但现有方法很大程度上仅限于单任务优化。将强化学习扩展到多个任务具有挑战性:联合优化会受到跨任务干扰和不平衡的影响,而级联强化学习则很麻烦,并且容易出现灾难性遗忘。我们提出了 DiffusionOPD,一种基于在线策略 蒸馏 (OPD) 的扩散模型的新多任务训练范例。 DiffusionOPD 首先独立训练特定任务的教师,然后沿着学生自己的推广轨迹将他们的能力提炼成统一的学生。这将单任务探索与多任务集成解耦,并避免了从头开始联合解决所有任务的优化负担。理论上,我们将 OPD 框架从离散标记提升到连续状态马尔可夫过程,导出封闭形式的每步 KL 目标,通过均值匹配统一随机 SDE 和确定性 ODE 细化。我们正式和实证地证明,与传统的 PPO 式策略梯度相比,这种分析梯度提供了更低的方差和更好的通用性。大量实验表明,DiffusionOPD 在训练效率和最终性能方面始终超越多奖励 RL 和级联 RL 基线,同时在所有评估基准上实现了最先进的结果。