论文
TopK-Guided:自适应、预算感知的激活稀疏性,实现高效的 LLM 推理
TopK-Guided: Adaptive, Budget-Aware Activation Sparsity for Efficient LLM Inference
摘要
激活稀疏性通过将不重要的激活设置为零来加速大语言模型 (LLM) 推理,以便可以跳过相应的计算。然而,现有的免训练方法会做出不同的权衡:基于阈值的方法(例如 TEAL)会根据每个 token 调整稀疏度级别,但不会严格控制实现的稀疏度,而基于 TopK 的方法(例如 WINA)会强制执行固定的稀疏度级别,但对每个 token 使用相同的稀疏度预算。尽管块灵敏度存在很大差异,但两者还在Transformer块之间应用相同的预算。我们引入了 TopK-Guided,这是一种免训练方法,通过将有界词元级稀疏性适应与敏感度感知的块级预算分配相结合来解决这两个限制。在 Llama-2 和 Llama-3 模型中,TopK-Guided 持续改进了 TEAL 和 WINA 的困惑度和下游精度,同时保留了与 WINA 基本相同的稀疏度相关投影计算,在高稀疏度下增益最大。消融表明这两个组件提供了互补的改进。