论文
平均评估掩盖了能力权衡:高稀疏性 LLM 剪枝的多源校准
Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning
摘要
校准数据通常被视为 后训练 LLM 修剪中的次要实现细节,因为平均评估仅表明效果不大。我们证明这个结论是一个平均伪影:在 SparseGPT 稀疏度为 60% 时,校准策略的平均常识精度仅相差 2.85 个点,但代码保留率却相差 51.9 个点。在 15 个来源中,能力分解分析揭示了相反的模式:校准困惑度与一般保留率呈正相关,但与数学或代码保留率呈负相关,因此没有评估出单一来源在各个能力方面均强。这一发现激发了能力平衡的多源校准。在相同的校准预算下,平衡的真实数据混合物的性能优于 LLaMA-3.1-8B 上每个评估的单一源,比 C4 好 18.8 个点;该优势随着稀疏性而增长,并在 LLaMA-3.1-70B 上持续存在。由于高级 LLM 的原始预训练数据通常无法访问,因此我们进一步引入了信息引导剪枝自校准(IGSP)。仅使用基本模型和评估分类法,IGSP 即可生成能力分层池,并在特定于能力的困惑度范围内选择低冗余样本,其性能比 Self-Cal 和 SGS 高出多达 4.8 个百分点。总之,这些结果将校准重新定义为能力覆盖问题,并将多源设计确定为在高稀疏性 LLM 修剪中保留能力的实用原则。