论文
SparseForge:通过 Hessian 引导软掩模退火实现高效半结构化 LLM 稀疏化
SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask
摘要
半结构化稀疏性提供了一种在本机硬件支持下加速 大语言模型 (LLM) 的实用路径,但 后训练 半结构化剪枝常常由于强结构耦合而遭受严重的质量下降。现有方法依赖大规模稀疏再训练来恢复精度,导致计算成本很高。我们提出了 SparseForge,一个 后训练 框架,它通过直接优化稀疏掩模而不是扩大再训练词元来提高恢复效率。 SparseForge 将 Hessian 感知重要性估计与软掩模的渐进退火结合到硬件可执行的结构化稀疏性中,从而实现稳定高效的稀疏恢复。在 2:4 稀疏度下的 LLaMA-2-7B 上,SparseForge 仅使用 $\textbf{5B}$ 重新训练词元即可实现 57.27% 的平均零样本准确度,超过了密集模型的 56.43% 准确度,并接近使用 $\textbf{40B}$ 词元的最先进方法的 57.52% 结果。 SparseForge 对准确性与效率权衡的这种改进在各个模型系列中是一致的。