论文
从层到子模块:重新思考基于替换的 LLM 压缩的粒度
From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression
摘要
大语言模型 (LLM) 的 后训练 压缩会删除整个架构组件,要么删除它们,要么用安装的模块替换它们。现有的基于替换的方法有两个设计约束:全层粒度和连续选择。我们认为这过于严格:事实上,预训练的 Transformer 中的冗余并不局限于连续区域,也不是均匀分布在注意力和前馈输出之间,这意味着不同的策略最好地近似不同的子模块类型,并且可移动组件不需要在连续的深度范围内聚集。基于这种直觉,我们引入了 SubFit(子模块级拟合残差替换),它在子模块级别压缩 LLM:Attention 和 FeedForward 子模块被选择为非连续的,并且每个子模块都接收自己的轻量级拟合残差旁路。 SubFit 运行 后训练,仅需要校准数据。在十个 LLM(五个基础、五个指令调整)、五个从 12.5% 到 37.5% 的稀疏度水平以及四个基于替换的基线中,SubFit 在评估的稀疏度水平上实现了最佳的总体困惑度与准确度权衡,在积极压缩下获得了更大的收益。在稀疏度为 25% 时,它保留了 84.6% 的密集下游精度,并导致 2.42 倍的困惑度下降,而最强基线分别为 81.6% 和 4.34 倍,同时提供可测量的推理加速和 KV 缓存节省。代码可在 https://github.com/eliacunegatti/SubFit 获取。