论文

Lens:重新思考基础文本到图像模型的训练效率

Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

模型训练预训练

摘要

我们推出了 Lens,这是一种 3.8B 参数 T2I 模型,其性能可与在各种基准测试中具有超过 6B 参数的最先进模型相媲美,甚至在某些情况下超越,同时需要的训练计算量显着减少。例如,Lens 所需的训练计算量仅为 Z-Image 的 19.3% 左右。 Lens 的训练效率除了其紧凑的模型大小之外还源于两个关键策略。首先,我们通过以下方式最大化每个训练批次的数据信息密度:(i) 在 Lens-800M 上进行训练,Lens-800M 是一个由 800M 密集字幕图像文本对组成的数据集,其字幕由 GPT-4.1 生成,平均包含约 109 个单词,提供比传统短字幕更丰富的语义监督;(ii) 从具有多种分辨率和不同长宽比的图像构建每个批次,从而扩大每个优化步骤的有效视觉覆盖范围。其次,我们通过仔细的架构选择来提高收敛速度,包括采用提供更好潜在表示的语义 VAE,并采用强大的语言编码器来加速优化,同时实现仅英语训练数据的多语言泛化。在 预训练 之后,我们将 RL 与分类驱动提示 (Lens-RL-8K) 和结构化奖励规则一起应用,以抑制伪影并提高视觉质量,使用具有 无需训练 系统提示搜索的推理器模块,以更好地使用户请求与模型保持一致,并应用基于 蒸馏 的加速进行 4 步推理。通过高效的训练和系统优化,Lens泛化到1:2到2:1的任意长宽比和高达1440^2的分辨率,并支持多种常用语言的提示。由于尺寸紧凑,Lens 在单个 NVIDIA H100 GPU 上可在 3.15 秒内生成 1024^2 图像,而其蒸馏涡轮版本可在 0.84 秒内执行 4 步生成。