论文
LeapAlign:通过构建两步轨迹在任何一代步骤中进行 后训练 流量匹配模型
LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
摘要
本文重点关注流量匹配模型与人类偏好的一致性。一种有前途的方法是 微调,通过流匹配的可微生成过程直接反向传播奖励梯度。然而,通过长轨迹反向传播会导致过高的内存成本和梯度爆炸。因此,直接梯度方法很难更新早期生成步骤,这对于确定最终图像的全局结构至关重要。为了解决这个问题,我们引入了 LeapAlign,这是一种 微调 方法,可以降低计算成本并实现从奖励到早期生成步骤的直接梯度传播。具体来说,我们通过设计两个连续的跳跃将长轨迹缩短为仅两个步骤,每个跳跃都跳过多个 ODE 采样步骤并在单个步骤中预测未来的潜伏。通过随机化跳跃的开始和结束时间步长,LeapAlign 可以在任何生成步骤实现高效稳定的模型更新。为了更好地利用这种缩短的轨迹,我们为那些与长生成路径更一致的轨迹分配了更高的训练权重。为了进一步增强梯度稳定性,我们大幅减少了梯度项的权重,而不是像以前的工作那样完全删除它们。当 微调 Flux 模型时,LeapAlign 在各种指标上始终优于最先进的基于 GRPO 的直接梯度方法,实现了卓越的图像质量和图像文本对齐。