论文
Nucleus-Image:用于图像生成的稀疏 MoE
Nucleus-Image: Sparse MoE for Image Generation
摘要
我们提出了 Nucleus-Image,一种文本到图像生成模型,通过匹配或超过 GenEval、DPG-Bench 和 OneIG-Bench 上的领先模型,同时每次前向传递仅激活大约 2B 参数,在质量与效率方面建立了新的帕累托前沿。 Nucleus-Image 采用稀疏专家混合 (MoE) 扩散 Transformer 架构和专家选择路由,将每层 64 个路由专家的总模型容量扩展到 17B 个参数。我们采用了一种针对推理效率进行优化的简化架构,完全从 Transformer 主干中排除文本标记,并使用联合注意力来实现跨时间步长的文本 KV 共享。为了提高使用时间步调制时的路由稳定性,我们引入了一种解耦路由设计,将时间步感知的专家分配与时间步条件的专家计算分开。我们通过多阶段过滤、重复数据删除、美学分层和图像描述整理,构建了一个由 1.5B 个高质量训练对组成的大规模训练语料库,涵盖 700M 个独特的图像。训练遵循渐进式分辨率课程(256 到 512 到 1024),每个阶段都采用多纵横比分桶,再加上专家能力因子的渐进稀疏化。我们采用 Muon 优化器,并分享我们为具有时间步长调制的扩散模型量身定制的参数分组方法。 Nucleus-Image 证明,稀疏 MoE 缩放是生成高质量图像的高效途径,可以以极小的推理成本实现具有显着更大的活动参数预算的模型的性能。这些结果是在没有任何类型的 后训练 优化的情况下实现的:没有强化学习,没有直接偏好优化,也没有人类偏好调整。我们发布了训练配方,使 Nucleus-Image 成为第一个达到此质量的完全开源的 MoE 扩散模型。