论文

更稀疏、更快、更轻 Transformer 语言模型

Sparser, Faster, Lighter Transformer Language Models

模型优化稀疏化

摘要

缩放自回归 大语言模型 (LLM) 推动了前所未有的进步,但也带来了巨大的计算成本。在这项工作中,我们通过利用 LLM 前馈层中的非结构化稀疏性来解决这些成本,这些组件负责大部分模型参数和执行 FLOP。为了实现这一目标,我们引入了一种新的稀疏打包格式和一组 CUDA 内核,旨在与现代 GPU 的优化执行管道无缝集成,从而在 LLM 推理和训练期间实现高效的稀疏计算。为了证实我们的成果,我们提供了 LLM 稀疏性的定量研究,证明简单的 L1 正则化可以导致超过 99% 的稀疏性,而对下游性能的影响可以忽略不计。当与我们的内核配合使用时,我们发现这些稀疏级别可以转化为大量的吞吐量、能源效率和内存使用优势,并且随着模型规模的扩大而增加。我们将在开源许可下发布所有代码和内核,以促进采用并加速研究,以将稀疏性建立为提高现代基础模型的效率和可扩展性的实用轴。