论文

Mage-Flow:用于图像生成和编辑的高效本机分辨率基础模型

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

应用与实践内容创作

摘要

大规模视觉生成器的能力越来越强,但训练、微调和部署成本高昂。我们推出了 Mage-Flow,这是一个紧凑的 4B 规模生成堆栈,用于高效的文本到图像生成和基于指令的图像编辑。该堆栈由两个共同设计的组件构建:Mage-VAE(一种轻量级高保真潜在标记器)和经过修正流匹配训练的本机分辨率多模态扩散 Transformer。 Mage-VAE 使用带有锚点潜在正则化的一步扩散式编码和解码,保留了强大的公共 VAE 的重建质量,同时将标记化成本降低了一个数量级以上。与本机分辨率打包和堆栈级 CUDA 内核融合相结合,该堆栈支持灵活分辨率训练,并将端到端训练吞吐量提高约 2.5倍。在此基础上,我们开发了一个完整的模型系列,其中包含用于生成和编辑的 Base、RL-aligned 和 Turbo 变体。 Diffusion-NFT 改善了提示跟随、文本渲染、美学质量和编辑保真度,而具有对抗性感知指导的几步 蒸馏 则生成用于低延迟推理的 4 步 Turbo 模型。尽管规模紧凑,Mage-Flow 和 Mage-Flow-Edit 在标准生成和编辑基准测试中实现了具有竞争力的性能。更重要的是,Turbo 变体使高分辨率生成和编辑对于交互式使用变得实用:在单个 NVIDIA A100 GPU 上以 1024^2$ 分辨率,Mage-Flow-Turbo 在 0.59 秒内生成图像,Mage-Flow-Edit-Turbo 在 1.02 秒内编辑图像,同时保持较小的内存占用。这些结果表明,仔细的分词器(主干)系统协同设计可以在高效的 4B 模型系列中提供强大的高分辨率生成和编辑功能。