论文
i1:强大的文本到图像模型的简单且完全开放的配方
i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models
摘要
扩散模型不断推动文本到图像生成的进步。然而,将最近的进展归因于特定的建模和数据选择是具有挑战性的:最先进的开放权重模型提供有限的消融,并且不公开其训练数据和完整的训练细节。研究界需要完全开放的(权重、数据和代码)模型作为进一步研究的基础;然而,现有的全开放型号在性能方面仍与领先型号存在显着差距。在这个项目中,我们通过 300 多个受控实验,总计 70 万多个 TPU v6e 小时,对文本到图像扩散训练和推理中的建模和数据设计选择进行了系统研究。我们的实验强调了一些用于训练强大模型的经验发现(例如,等权重是混合精选数据集的强默认值)和简单的设计决策(例如,更大的文本编码器适配器以最少的添加参数提高性能)。在这些见解的指导下,我们仅使用公开可用的数据集来训练 i1,这是一个 3B 参数文本到图像扩散模型。 i1 在五个代表性基准(GenEval、DPG、PRISM、CVTG-2K 和 LongText)上与领先模型具有竞争力,并且平均优于现有最好的完全开放模型 29.5 个绝对百分点。我们提供 i1 检查点、训练和推理代码以及数据处理管道。我们的发现和 i1 配方共同为未来文本到图像扩散模型的开放研究奠定了实践基础。我们的代码可在 https://github.com/zlab-princeton/i1 获取。