论文

LLaDA-Image:使用完全开放的训练方法构建强大的图像生成器

LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

模型训练预训练

摘要

我们推出了 LLaDA-Image,这是一个统一框架,它将从头开始训练的 6B Diffusion Transformer (DiT) 与基于 LLaDA2.0-Mini 扩散语言模型主干的冻结视觉语言理解模块配对。我们不是从一开始就严重依赖配对的图像文本数据,而是首先通过仅图像 预训练 和中期训练构建强大的视觉生成先验。生成管道包含 2.2 亿个样本,其中 98 个是真实图像。为了实现高效且可扩展的优化,我们在整个 DiT 中使用无参数 RMSNorm 以及 Muon 优化器。由此产生的统一模型可生成高度逼真的图像,同时准确遵循细粒度的编辑指令。我们进一步将 LLaDA-Image 提炼为 LLaDA-Image-Turbo,从而能够在 2-4 个采样步骤中进行快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英语和中文赛道上分别获得了 53.53 和 53.38 的总分,在两个赛道上都创下了开源模型的新的最高水平。为了支持对强大且高效的生成模型的进一步研究,我们发布了模型权重、训练代码和详细配方。