论文

隐藏在众目睽睽之下:极端 LLM 稀疏性的规范元素的被忽视的意义

Hidden in Plain Sight: The Overlooked Significance of Canonical Elements for Extreme LLM Sparsity

摘要

大语言模型 (LLM) 在激进的稀疏化下通常被认为是脆弱的,并且保持可靠的性能通常需要坚持适度的稀疏度水平。然而,最近的研究表明,LLM 对高稀疏性的适应能力比以前想象的更强,将问题重新定义为设计挑战而不是基本限制。在这项工作中,我们通过重新审视在这种规模上相对而言尚未得到充分探索的基本剪枝策略来挑战非结构化 后训练 LLM 剪枝的感知极限。通过具有二阶显着性的渐进稀疏化框架以及与稀疏性进展相协调的持续训练,我们表明预训练的 LLM 可以保持远远超出通常研究的稀疏性机制的强大性能。在 LLaMA-2 和 Qwen-3 模型系列中,我们的方法将困惑度和下游精度提高到 99% 的稀疏度,超越了当前最先进的和代表性的基线。准确地说,在 LLaMA-2-7B 上,我们的方法在稀疏度为 95\% 和 99\% 时分别实现了 13.48 和 19.67 的 WikiText-2 困惑度,同时在稀疏度为 95\% 时提供了 3.23$\times$ 解码加速和 6.21$\times$ 内存节省。总而言之,我们的结果表明,LLM 可以在保持强大性能的同时达到极端稀疏性,为进一步改进该体系中的稀疏模型奠定了基础。