论文
调整扩散模型的明确批评指导
Explicit Critic Guidance for Aligning Diffusion Models
摘要
在线强化学习对于将扩散模型与不可微目标相结合变得越来越重要。然而,现有方法在沿着去噪轨迹分配细粒度信用以及实现稳定的基于价值的优化方面仍然面临局限性。我们提出了一种用于扩散 后训练 的状态对齐潜在行动者批评家框架,其中扩散模型充当其自己的时间步条件值函数,并直接在噪声潜在状态上预测值。这使得轨迹级 PPO 训练成为可能,通过简单的调节和值预训练策略支持稳定的 Actor-Critic 优化,并且自然地允许学习的 Critic 被重用于推理时间引导。我们进一步将框架扩展到多奖励优化,其中具有互补奖励的联合训练有助于缓解 奖励作弊。在基于 UNet 和 DiT 的骨干网中,我们的方法在单奖励和多奖励基准上始终优于先前的组相关 RL 和 Actor-Critic 基线,而测试时间引导在生成质量方面提供了额外的收益。