论文

一步视觉生成的表示分布匹配

Representation Distribution Matching for One-Step Visual Generation

摘要

我们阐明了表示分布匹配(RDM)的设计空间,这是我们通过在冻结的预训练编码器下匹配生成的特征分布和参考特征分布来训练一步图像生成器的范例的名称。我们确定了两个设计轴、如何比较分布以及比较它们的表示形式,并沿着它们进行对照研究得出三个发现。首先,经典 MMD 在十年前还无法训练出令人信服的生成器,但一旦估计正确,它就会成为一个强大且可扩展的目标。其次,生成的批次是操作变量,最佳值高于 2048,远远超出了通常的批次大小。第三,任何单个表示都可以被玩弄,低于真实分数,而图像仍然明显是假的,因此我们与一组平衡的编码器进行匹配,并使用 SW_r14 进行评估,SW_r14 是超过 14 个编码器的 Sliced-Wasserstein 距离,独立于训练损失并抵抗游戏。结合首选选择会产生改进的 RDM (iRDM):它将 ImageNet 上的单步技术水平设置为 SW_r14 1.30,由 PickScore 证实,PickScore 是我们的目标从未优化的人类偏好代理,在 71.2% 的匹配样本上,它比之前最好的单步生成器更喜欢它。同样的方法将四步 FLUX.2 [klein] 后训练为一步生成器,在 90 H200 GPU 小时内超越了 GenEval 上的四步版本(0.826 到 0.794)和 PickScore 上的四步版本(22.76 到 22.58)。项目页面:https://alan-lanfeng.github.io/rdm/。