论文

PAST:高效扩散模型的快速自适应采样终止

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

模型训练强化学习

摘要

虽然扩散模型在文本到图像任务中取得了重大进展,但在直接优化下游目标时仍然表现出局限性。尽管强化学习(RL)可以实现有针对性的优化,但现有方法通常受到低效率 微调 和稀疏奖励的限制。为了应对这些挑战,我们提出了 PAST,它提供差异化​​的奖励,同时通过共同感知去噪进度和提示难度来自适应调节训练片段长度。具体来说,我们设计了一种内在奖励范例来补偿稀疏的外在奖励,并引导模型探索更有效地偏离噪声模式的路径。我们进一步为内在奖励提供了理论依据。然后,PAST动态监控去噪完成情况以及图像结构和提示语义之间的语义对齐。当两个指标都满足生成要求时,系统自适应地终止训练。这使得能够根据提示难度和当前生成过程适当分配剧集长度。最后,基于预测的残余噪声水平,我们建立了双自适应协调机制。具体来说,它不仅平衡了外在奖励和内在奖励,而且平衡了探索和收敛。实验结果表明,PAST 通过其双重自适应调节机制,将现有 RL 微调 方法的计算效率提高了 66.7%,同时将偏好优化质量提高了 29.5%。