论文
探索紧凑统一图像生成模型的性能前沿
Exploring the Performance Frontier of Compact Unified Image Generation Models
摘要
我们推出了 Swift-Image,这是一个紧凑的统一模型,用于文本到图像生成、单图像编辑和多图像编辑。我们的目标是探索在有限的计算预算下通过系统训练工程可以将相对较小的视觉生成器推到多远。 Swift-Image采用高效的6B单流DiT和渐进式训练管道,从广泛的语义覆盖演进到更高分辨率、更强的视觉质量和统一的生成编辑监督。对于后训练,我们采用并行专家强化学习,然后采用多教师同策略 蒸馏来减轻异构目标之间的干扰。我们使用提示增强器进一步将高级推理与像素级渲染分离,该提示增强器将用户请求转换为与生成器对齐的视觉规范。为了高效部署,结构修剪和几步 蒸馏 产生 3B 和加速变体。 Swift-Image 在仅 6B 参数和 243K GPU 训练小时的评估开源模型中实现了领先的综合性能;压缩的 3B 模型几乎不会造成任何损失,而少步 蒸馏 通过大幅减少采样步骤进一步提高了聚合编辑性能。我们的研究还总结了架构、数据课程、后训练、即时增强和模型压缩的实践课程。