论文

校准引导 LLM 压缩的输出空间分配成本:实证研究

Output-Space Allocation Costs for Calibration-Guided LLM Compression: An Empirical Study

模型优化模型压缩

摘要

大语言模型 (LLM) 的 无需训练 压缩方法通常使用校准数据来指导压缩决策。 ROCKET 是一种将稀疏字典分解与多选择背包问题 (MCKP) 分配相结合的最新方法,从输出重建目标导出其每层分解,但使用权重空间 Frobenius 误差作为 MCKP 分配成本。我们研究将分配成本与输出空间目标保持一致是否可以提高压缩模型的保真度。在 Qwen3-8B 上,压缩率为 50% 时,我们的 ROCKET-ActCost 在 8 个零样本基准测试中的平均准确度提高了 0.8 个百分点(53.1% vs 52.3%),但 WikiText 的困惑度增加了 16%(61.46 vs 52.98)。这种准确性与困惑度的权衡表明,不同的分配目标有利于不同的下游指标。权重空间和输出空间误差之间的高度相关性($>$0.99)限制了分配差异,解释了效应大小的适度。在 Llama-3.2-1B 上,压缩率为 20% 时,两种方法产生几乎相同的结果(53.3% vs 53.5% 准确度,14.45 vs 14.66 PPL),这表明成本函数的影响在较低压缩比下较小。