论文
通过分配奖励优化视觉生成模型
Optimizing Visual Generative Models via Distribution-wise Rewards
摘要
用于视觉生成的传统强化学习策略通常采用样本奖励函数,但这种做法经常导致 奖励作弊 ,从而降低图像多样性并引入视觉异常。为了解决这些限制,我们提出了一种新颖的框架,该框架使用分布奖励来微调生成模型,确保与现实世界的数据分布更好地保持一致。与单独评估样本的奖励不同,分布明智的奖励考虑了样本的数据分布,减轻了所有样本独立朝同一方向优化时发生的模式崩溃问题。为了克服估计这些奖励的高昂计算成本,我们引入了一种子集替换策略,该策略通过仅更新生成的参考集的一小部分子集来有效地提供奖励信号。此外,我们应用强化学习来优化事后模型合并系数,有可能减轻由于在常规强化学习实践中引入随机微分方程(SDE)而导致的训练推理不一致。大量实验表明,我们的方法显着提高了各种基础模型的 FID-50K,SiT 从 8.30 提高到 5.77,EDM2 从 3.74 提高到 3.52。定性评估还证实,我们的方法在保持样本多样性的同时增强了感知质量。