论文
嵌入预测有助于图像生成
Embedding Prediction Helps Image Generation
摘要
在扩散Transformer中,类标签或文本提示被嵌入一次,并且在每个去噪步骤中重复使用相同的条件。我们询问预测的嵌入是否可以作为这个条件。下一个嵌入预测自回归 (NEPA) 训练 Transformer 来预测序列中的下一个连续嵌入。在生成过程中,干净图像紧随噪声图像之后,因此其嵌入是条件和噪声图像之后的下一个嵌入。我们训练一个 NEPA 模型,通过多重嵌入预测一次性预测它们,并且在嵌入条件生成中,DiT 生成器以这些预测为条件,在每个去噪步骤中重新计算,因此条件信号适应当前的噪声状态。类条件 ImageNet $256\times256$ 上的实验研究了生成器的条件、多重嵌入预测的设计以及两个模型的缩放。 NEPA 模型在每个采样步骤中添加了第二个网络;有了它,并与 REPA 相结合,我们的最终模型 NEPA-DiT-XL 使用 REPA 大约三分之一的训练计算达到了 1.32 的 FID。