论文

聚舟1.0技术报告:首个完全基于国产AI加速器训练的边缘原生文本转图像基础模型

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

模型优化端侧模型

摘要

文本到图像 (T2I) 扩散模型通常需要大量计算资源和云基础设施,这对边缘部署在延迟、成本和用户隐私方面提出了重大挑战。我们推出 JuZhou 1.0,这是一种超轻量级 T2I 基础模型,专为完全离线、设备上执行而设计。 JuZhou 1.0通过四个关键设计实现其效率:(1)紧凑的图像生成主干,由0.385B参数的去噪U-Net和1.90M参数的蒸馏解码器组成,总共约0.387B参数; (2) 修正流训练结合DMD2 蒸馏,将推理减少到4个采样步骤; (3) 在 900 万个精选图像文本对上训练中文语义对齐,在推理时无需外部翻译即可直接进行中文提示; (4)在国产曙光K100人工智能加速器上完成的训练和蒸馏流水线,不依赖NVIDIA GPU进行训练或蒸馏。尽管规模紧凑,JuZhou 1.0 的 28 步基本模型的 GenEval 总体得分为 0.69,优于已发布的基线,包括 SDXL(2.6B,0.55)、SD3-Medium(2B,0.62)和 IF-XL(4.3B,0.61)。我们进一步验证了 Android 上完整的诗歌到图像管道和 iOS 上的核心 CLIP-U-Net-VAE 生成分支。在搭载 Snapdragon 8 Elite Gen 5 移动平台的智能手机上,4 步 U-Net 去噪分支的运行时间约为 1.6 秒,而在小米 17 Pro Max 上,完整的 Android 诗歌到图像管道需要 4.5 秒,并进行设备上的提示细化。这些结果将聚周1.0定位为一种实用的移动文本到图像生成方法,并为中文原生生成、国内计算训练以及一次性安装后完全离线的设备上部署提供了具体参考。