论文
微调 扩散模型的高效伴随匹配
Efficient Adjoint Matching for Fine-tuning Diffusion Models
摘要
奖励 微调 已成为在文本到图像生成中将预训练的扩散和流动模型与人类偏好对齐的常用方法。在基于奖励梯度的方法中,伴随匹配(AM)通过将奖励 微调 转换为随机最优控制(SOC)问题来提供原则性的表述。然而,AM 不可避免地需要大量的计算成本:它需要(i)在无记忆动力学下对完整生成轨迹进行随机模拟,从而导致大量的函数评估,以及(ii)沿每个采样轨迹对伴随状态进行向后 ODE 模拟。在这项工作中,我们观察到这两个瓶颈都与从预训练模型继承的 \textit{非平凡基本漂移} 密切相关。受这一观察的启发,我们提出了\textbf{高效伴随匹配(EAM)},它通过使用\textit{线性基础漂移}和相应修改的\textit{终端成本}重新表述SOC问题来显着提高训练效率。这种重新制定消除了低效率的两个根源;它支持使用几步确定性 ODE 求解器进行训练时采样,并生成消除后向伴随模拟的封闭式伴随解。在标准文本到图像奖励 微调 基准测试中,EAM 的收敛速度比 AM 快 4 倍,并且在各种指标(包括 PickScore、ImageReward、HPSv2.1、CLIPScore 和 Aesthetics)上均匹配或超越 AM。