论文

Sumi:从头开始开放统一扩散语言模型

Sumi: Open Uniform Diffusion Language Model from Scratch

模型训练预训练

摘要

扩散模型已成为自回归模型的有前途的替代方案。其中,统一扩散语言模型(UDLM)允许在任何步骤更新任何词元,原则上可以实现更灵活的生成。然而,目前还没有在大参数规模和大 词元预算 上从头开始预训练 UDLM。自回归模型和掩模扩散模型都已经拥有了可供社区研究和构建的大规模模型;均匀扩散没有。大规模的预训练 UDLM 将为研究缩放行为、生成动态、可控性以及与已建立的自回归和掩蔽扩散模型的权衡提供一个清晰的参考点。为此,我们引入了 Sumi(日语中的“墨水”),这是一种在 1.5T 词元上从头开始预训练的完全开放的 7B 统一扩散语言模型。 Sumi 在知识、推理和编码基准上的表现与在可比 词元预算 上训练的自回归模型具有竞争力,但在常识基准上表现不佳,我们的教育密集型数据混合可能是其中的一个因素。我们发布了模型权重、检查点和完整的训练方案,包括公开可用语料库的数据混合的完整规范。我们希望这个版本能够使社区能够大规模地研究原生均匀扩散,并促进对其目前尚知之甚少的方面的研究。