论文

DanceOPD:同策略 生成场 蒸馏

DanceOPD: On-Policy Generative Field Distillation

摘要

现代图像生成需要一个统一不同功能的单一模型,包括文本到图像 (T2I)、本地编辑和全局编辑。然而,这些能力很少自然地结合在一起,而且经常发生冲突。例如,编辑往往会降低 T2I 性能,而全局编辑和本地编辑会相互干扰。因此,有效组合这些功能已成为图像生成 模型训练 的核心挑战。为了解决这个问题,我们引入了 DanceOPD,这是一种用于流匹配模型的 同策略 生成场 蒸馏 框架,它将每个样本路由到一个能力场,查询一个低噪声学生诱发的状态,并使用简单的速度 MSE 目标进行训练。将每个能力源定义为共享流状态空间上的速度场,学生从在其自身采样轨迹的状态上查询的字段中学习以组成专家能力。该公式还吸收了操作员定义的字段,例如无分类器指导。 T2I、编辑、现实场吸收和 CFG 吸收的综合实验表明,我们的方法改进了多能力组合,增强了目标能力,同时保持了锚生成质量。我们相信这项工作为流匹配模型中的生成场 蒸馏 建立了一条实用的路线。