论文

改进的大语言扩散模型

Improved Large Language Diffusion Models

模型训练预训练

摘要

现代 大语言模型 主要接受自回归分解和因果注意力的训练。我们提出了 \emph{iLLaDA},这是一种从头开始训练的 8B 掩码扩散语言模型,具有完全双向注意力。 iLLaDA 在整个 预训练 和监督 微调 (SFT) 中保持掩蔽扩散目标,将 预训练 扩展到 12T 词元,并将 微调 扩展到 25B 词元指令语料库,持续 12 个时期。我们进一步使用可变长度生成来提高效率,并引入基于置信度的评分来进行多项选择评估。与 LLaDA 相比,iLLaDA 在通用、数学和代码基准方面都有广泛改进;例如,iLLaDA-Base 在 BBH 上提高了 21.6 分,在 ARC-Challenge 上提高了 14.9 分,而 iLLaDA-Instruct 在 MATH 上提高了 14.5 分,在 HumanEval 上提高了 16.5 分。尽管采用非自回归训练,iLLaDA 在多个基准测试中仍与 Qwen2.5 7B 保持竞争力。这些结果表明,从头开始的完全双向扩散训练是通往强语言模型的一条有竞争力的道路。模型权重和代码:https://github.com/ML-GSAI/LLaDA。