论文
通过 Wasserstein 梯度流的奖励引导 微调 一步生成模型
Reward-guided Fine-Tuning of One-Step Generative Models via Wasserstein Gradient Flow
摘要
为了降低生成模型的时间复杂度,最近出现了通过在单次前向传递中从噪声到数据的直接映射的一步生成模型。然而,奖励引导的一步生成模型 微调 方法在很大程度上仍未得到探索。为了解决这个问题,我们从最优传输的角度考虑单步生成器,研究 Wasserstein 梯度流 (WGF),以对概率空间中的平滑且受控的分布演化进行建模。然后,我们通过 WGF 提出了一种新颖的奖励引导 微调 一步生成模型。我们推导出一种不需要奖励梯度的实用训练方法,从而处理不可微分和可微分奖励。此外,我们的方法提供了平滑稳定的奖励引导的分布更新,同时减轻了 奖励作弊 和模式崩溃。在 2D 合成数据、CIFAR-10 和 ImageNet 256$\times$256 上进行的实验,具有不同的奖励,包括 JPEG(in)压缩性、类概率、黑白和 CLIP 对齐,表明我们的方法与基线相比实现了更好的奖励对齐。