论文
不同的提示,不同的等级:基于 SVD 的 LLM 压缩的提示感知动态等级选择
Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression
摘要
大语言模型 (LLM) 的规模迅速增长,产生了大量的内存和计算成本,阻碍了高效部署。奇异值分解 (SVD) 已成为一种有效的 后训练 压缩技术,但现有的基于 SVD 的方法依赖于静态秩截断,将奇异分量的固定前缀应用于所有输入,无论其多样性如何。我们发现这种静态设计的两个局限性:最佳排名因各个提示而异,并且所选排名对校准集的选择很敏感,导致不同输入的性能不佳。为了应对这些挑战,我们提出了 $\textbf{PARSE}$,一个 后训练 框架,用于 $\textbf{P}$rompt-$\textbf{A}$ware $\textbf{R}$ank $\textbf{S}$ 在 SVD 压缩的 LLM 中选择 $\textbf{E}$xperts。 PARSE 离线训练线性路由器以执行提示感知的排名选择,通过监督路由器针对大规模语料库的密集模型输出,将其与校准信息解耦。我们进一步观察到,排名选择模式在语义相似的提示之间共享,并且在解码步骤中保持稳定,从而允许在推理时直接从模式缓存提供适当的排名子集。 PARSE 辅以专家内存聚合和内核融合以提高系统级效率,与现有的基于 SVD 的管道正交,并持续提高模型质量和推理效率。 PARSE 与四种基于 SVD 的代表性方法集成,在 LLaMA-7B 上以 0.6 的压缩比将平均任务精度提高了 10%,并且与本机 SVD 执行相比,预填充速度提高了 2.5 $\times$,解码速度提高了 2.4 $\times$。