论文
DiffusionGemma 技术报告
DiffusionGemma Technical Report
摘要
我们引入了 DiffusionGemma,这是一种实验性开放权重语言模型,它使用离散扩散以极高的速度生成文本。 DiffusionGemma 不是一次解码一个词元,而是并行迭代地细化 256 个词元块,避免了传统自回归 (AR) 大语言模型 的顺序解码瓶颈。我们不是从头开始训练,而是通过 微调 获得 DiffusionGemma,即具有 3.8B 激活参数和 25.2B 总参数的专家混合 Gemma 4 模型。我们计算效率高的两阶段训练管道使用的起始 AR 模型总训练 词元预算 的比例不到 10%。第一阶段使用有监督的微调进行双向去噪教学,第二阶段将强化学习与采样器蒸馏相结合,共同提高生成质量和推理效率。 DiffusionGemma 为生成速度和模型能力之间的权衡建立了一个新的帕累托前沿。在我们完整的评估套件中进行平均,它每次前向传递生成约 20 个词元,并在单个 NVIDIA H100 GPU 上每秒实现约 1,500 个输出词元,即使使用最先进的 推测解码,这也比 AR 模型快得多。 DiffusionGemma 还保留了起始模型对思维模式、多模式输入和长上下文的支持。尽管扩散 微调,它仍然能够生成 AR,而性能仅略有下降,这表明了混合扩散-AR 解码的路径。