论文
DiffusionBench:关于 Diffusion 的整体评估 Transformer
DiffusionBench: On Holistic Evaluation of Diffusion Transformers
摘要
关于图像生成的 Diffusion Transformer (DiT) 研究已收敛到单一评估设置:ImageNet 上的类条件生成。虽然方法改进了 FID 和相关指标,但越来越不清楚它们是否反映了生成建模的真正进展。自然的替代方案,即文本到图像(T2I)生成,被认为成本太高或不方便训练和评估,并且经常被跳过。我们认为这种看法不再成立。我们推出 NanoGen,一个统一的 DiT 训练和评估框架。 NanoGen 与 ImageNet 上最先进的 DiT 基线相匹配,并且通过 12 行配置更改,还可以训练有竞争力的文本到图像模型。目前,它支持 ImageNet 和 T2I 设置下的 RAE、VAE、像素空间和 MeanFlow 扩散方法。在 NanoGen 下,训练 T2I 需要与 ImageNet 相当的计算能力。使用 NanoGen 训练 21 个潜在扩散模型后,我们观察到方法排名显示 ImageNet 和 T2I 生成之间没有很强的相关性:三个指标的 Pearson 相关性在 -0.377 和 -0.580 之间。这表明改进类条件 ImageNet FID 的方法可能在 T2I 上没有相应的改进,这清楚地表明了在这两个任务上评估 DiT 的必要性。为此,我们总结了 ImageNet 和文本到图像的结果,从而产生了 DiffusionBench,这是 DiT 研究的整体基准。我们建议仅报告 DiffusionBench 来代替 ImageNet:改进 DiffusionBench 的方法更有可能反映更广泛的进展。