论文

训练像素空间文本到图像扩散模型的实证研究

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

模型训练预训练

摘要

本文研究了生成建模中一个日益重要的主题:像素空间扩散模型。尽管许多研究都探讨了这个主题,但大多数都集中在小规模或班级条件设置上。因此,训练像素空间模型以与成熟的潜在空间模型相媲美或超过的实用方法仍然难以捉摸。通过全面的实证研究,我们首先观察到像素空间中的直接大规模 预训练 收敛速度比潜在空间中慢得多。这一观察激发了一种潜在到像素的策略,该策略在潜在空间中有效地获取生成先验,并在 后训练 期间过渡到像素空间。然后,我们系统地研究控制这种转变的关键设计选择,包括权重初始化、数据组合、预测目标、解码器架构和噪声调度,并确定一种实用的方法,使所得的像素空间模型匹配或优于其潜在空间模型,同时提供 3.18 至 4.75 倍的端到端推理加速。我们希望我们的研究结果为像素空间生成的未来研究提供有用的经验见解和实用指南。