论文
SOAR:扩散模型中最佳对准和细化的自校正
SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models
摘要
用于扩散模型的 后训练 管道目前有两个阶段:针对策划数据的监督 微调 (SFT) 和带有奖励模型的强化学习 (RL)。他们之间存在着根本性的差距。 SFT 仅在从前向噪声过程中采样的 真值 状态上优化降噪器;一旦推理偏离这些理想状态,后续的去噪依赖于分布外泛化而不是学习校正,表现出与自回归模型相同的暴露偏差,但沿着去噪轨迹而不是标记序列累积。强化学习原则上可以解决这种不匹配问题,但其终端奖励信号稀疏,存在贡献分配困难,并且存在 奖励作弊 风险。我们提出了 SOAR(最佳对齐和细化的自我校正),这是一种填补这一空白的偏差校正 后训练 方法。从真实样本开始,SOAR 对当前模型执行单次停止梯度的采样轨迹,对产生的偏离轨迹状态重新进行噪声处理,并监督模型转向原始干净目标。该方法是 同策略,无奖励,并提供密集的每时间步监督,不存在贡献分配问题。在 SD3.5-Medium 上,与 SFT 相比,SOAR 将 GenEval 从 0.70 提高到 0.78,将 OCR 从 0.64 提高到 0.67,同时提高所有基于模型的偏好分数。在受控的特定奖励实验中,尽管无法访问奖励模型,SOAR 在美学和文本图像对齐任务的最终指标值上都超过了 Flow-GRPO。由于 SOAR 的基本损失包含标准 SFT 目标,因此它可以在预训练后直接取代 SFT 作为更强的第一个 后训练 阶段,同时保持与后续 RL 对齐完全兼容。