论文

改善可控生成:通过$x_0$-监督更快的训练和更好的性能

Improving Controllable Generation: Faster Training and Better Performance via $x_0$-Supervision

模型训练监督微调与指令调优

摘要

文本到图像(T2I)扩散/流动模型最近在视觉保真度和文本对齐方面取得了显着进展。然而,当用户需要精确控制图像布局时,它们仍然受到限制,而仅靠自然语言无法可靠地表达这一点。可控生成方法通过附加条件增强了初始 T2I 模型,更容易描述场景。先前的工作直接训练增强网络,其损失与初始网络相同。虽然乍一看很自然,但在某些情况下,这可能会导致收敛之前需要很长的训练时间。在这项工作中,我们通过详细分析可控扩散模型的去噪动力学,重新审视其训练目标。我们表明,对干净目标图像的直接监督(称为 $x_0$-supervision)或等效的扩散损失重新加权可以产生更快的收敛。多个控制设置的实验表明,根据我们的新指标(收敛曲线下的平均面积 - mAUCC),我们的公式可将收敛速度提高高达 2$\times$,同时还提高了视觉质量和调节准确性。我们的代码可在 https://github.com/CEA-LIST/x0-supervision 获取