论文
LLM压缩的能力缩降定律
Capability Scaling-Down Laws for LLM Compression
摘要
LLM压缩降低推理成本与内存需求,但方法与配置的选择仍在很大程度上凭经验,因为可比的资源缩减会产生不同的能力损失。我们系统研究剪枝、量化与蒸馏下LLM压缩的能力缩降定律:框架度量数学、代码生成与问答的能力损失,并将这些测量与模型规模、训练阶段、压缩设置、数据可用性及训练暴露相关联。我们发展简单的预测关系并评估其准确性、测量效率及对未见配置与模型状态的泛化。跨剪枝层级共享密度响应使拟合剪枝预测器所需的配置测量减半:在新的Pythia状态、预注册的OLMo-2测试状态及Wanda剪枝下,紧凑关系在数学与代码上与全量测量拟合的回归相差不超过每token 0.020 nats(系数按设置重拟合)。受控蒸馏实验表明重度数据复用的代价在问答分布间复现,而净收益取决于评估分布。我们进一步以数值选型对比配置中位数与固定方法优先级来评估预测的决策价值:跨两模型族的独立评估显示,在所测候选集内选型获得了问答跨方法收益的大部分,固定方法优先级即达相同遗憾,数学与代码的机会较小。结果澄清了能力缩降定律的预测范围及其在压缩选型中的用途。代码/项目页:https://github.com/LabRAI/scaling_down_law。