论文
SeFi-Image:具有语义优先扩散的文本到图像基础模型
SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
摘要
训练图像生成基础模型消耗大量资源。以前的方法试图利用语义指导来加速训练过程,但他们的实验仅在 ImageNet 等简单数据集上以低分辨率和小规模模型进行。在本文中,我们提出了 SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,这是一种新颖的潜在扩散建模范式。我们以三种模型尺度(1B、2B 和 5B 参数)实例化 SeFi-Image,从而能够系统地研究缩放行为并在不同的计算预算下灵活部署。值得注意的是,我们最大的 5B 模型仅使用 125K A800 GPU 小时进行训练,相当于 Z-Image 使用的训练计算量的大约 10-20%。然而,它取得的结果与 Qwen-Image 和 Z-Image 相当甚至优于 Qwen-Image 和 Z-Image。尽管训练计算量不大,SeFi-Image 在各种基准测试中仍取得了出色的性能,包括 GenEval、DPG、LongTextBench、OneIG 和 CVTG-2K。此外,我们为每个模型规模提供 DMD2 蒸馏的几步涡轮变体,以适应不同的硬件限制和延迟要求。我们公开发布我们的代码、权重,并希望这项工作为社区提供有关 T2I 生成的语义引导扩散建模的有用见解,同时还提供实用且易于部署的模型选项。