论文

任务感知谱修剪:用于高效 LLM 推理的混合掩模框架

Task-Aware Spectral Pruning: A Mixture-of-Masks Framework for Efficient LLM Inference

摘要

静态修剪对每个提示施加一种稀疏结构,即使推理、检索、生成、编码和翻译可能依赖于语言模型的不同部分。我们引入了任务感知频谱修剪(TASP),这是一种训练后框架,可根据测量的特定于任务的消融效果校准模块级频谱描述符,在稀疏掩码构建期间关闭分组查询注意和 SwiGLU 依赖性,并将每个用户转向一个在预填充和解码过程中保持固定的已编译掩码。在完全校准之前,模块不相交导频首先确定频谱信号是否具有信息性。根据规定的追溯操作规则,飞行员通过了评估的 Llama-3-8B 和 Llama-3-70B 检查点,但拒绝了 Qwen2.5-1.5B,这表明适用性取决于模型而不是通用的。在主动 FLOP 减少 43% 的情况下,Llama-3-70B 基准测试Harness保留了 97.7 +/- 0.2% 的密集 BF16 分数。在单个 A100 80GB 上部署匹配的 INT8 权重/BF16 计算运行时中,编译的稀疏路径相对于密集 BF16 保留了 97.3 +/- 0.2%,并将解码延迟从 45.2 +/- 0.4 减少到 31.3 +/- 0.4 毫秒/词元,从而产生 1.44 倍的加速。分解消融、不相交模块测试、编译的结构化基线、路由损坏研究以及明确的 136 GPU 小时校准审核进一步界定了这些收益的来源和操作机制