论文

多目标的阶梯级去噪时间扩散对齐

Step-level Denoising-time Diffusion Alignment with Multiple Objectives

模型训练强化学习

摘要

强化学习 (RL) 已成为使扩散模型与人类偏好保持一致的强大工具,通常通过在 KL 正则化约束下优化单个奖励函数来实现。然而,在实践中,人类偏好本质上是多元化的,对齐的模型必须平衡多个下游目标,例如美学质量和文本图像一致性。现有的多目标方法要么依赖于成本高昂的多目标 RL 微调,要么依赖于在去噪时融合单独对齐的模型,但它们通常需要访问奖励值(或其梯度)和/或在生成的去噪目标中引入近似误差。在本文中,我们重新审视扩散模型的 RL 微调 问题,并通过引入阶梯级 RL 公式来解决确定最优策略的棘手问题。在此基础上,我们进一步提出了多目标步进级去噪时间扩散对齐(MSDDA),这是一种无需重新训练的框架,用于将扩散模型与多个目标对齐,获得封闭形式的最佳反向去噪分布,均值和方差直接用单目标基础模型表示。我们证明这个去噪时间目标与步进级 RL 微调 完全等效,不会引入近似误差。此外,我们提供了数值结果,这表明我们的方法优于现有的去噪时间方法。