论文

D2PO:通过动态偏好优化扩散采样器

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

模型训练偏好优化

摘要

我们提出了 D2PO(动态直接偏好优化),这是一个原则框架,用于优化关于时间步计划和无分类器指导(CFG)权重的扩散采样策略。我们的工作是受到现有学生-教师回归框架的根本限制的推动;低 NFE 学生采样器被训练来模仿高 NFE 教师,通常会牺牲高频纹理保真度,同时保留粗糙的全局结构,从而使采样器与感知质量错位。 D2PO 利用直接偏好优化 (DPO) 框架,将采样器优化重新表述为基于偏好的对齐问题,从而解决了这一挑战。为了使 DPO 适用于扩散采样器,我们将采样策略建模为基于能量的模型 (EBM),将偏好比较转化为易于处理的能量差异。我们进一步引入了一种直接源自预训练评分网络的新颖能量公式,能够在扰动空间中进行偏好评估,共同捕获结构一致性和细粒度细节。此外,我们引入了动态偏好,其中随着采样策略的学习,用于对齐的首选样本逐渐改进。这种自我改进机制用迭代的、偏好引导的细化过程取代了严格的静态教师监督,提供了逐渐更强的对齐信号。大量实验表明,D2PO 更忠实地使扩散采样器与感知质量保持一致,释放了高质量教师的全部潜力,并在低 NFE 约束下始终优于传统的基于回归的调度器。