论文

LLM 中量化损伤的结构:为什么下一位应该在全球范围内花费

The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally

模型评测模型行为与机制分析

摘要

后训练 量化 (PTQ) 广泛用于降低服务 大语言模型 (LLM) 的成本,但其准确性成本不均匀,并且通常根据模型进行调整。我们研究量化损伤发生的位置以及如何分配少量的额外精度预算。在 4 个架构系列中的 9 个开放权重模型中使用因果混合精度干预作为 真值(依次将每层提高到 8 位并测量其恢复的精度),我们测试了 3 个直观的假设:量化损伤存在于模型计算的任务电路中,或存在于权重统计中。他们都没有预测哪些层受益于恢复的精度。相反,恢复是分散的:对于 9 个模型中的 8 个,恢复 75% 的间隙大约需要一半的层数;唯一的例外是 Qwen3-8B,其浓度非常集中。在匹配的精度预算下,全局花费在更精细的量化粒度上,比本地修复所有 8 个 group-128 兼容模型(除 OpenLLaMA 之外的所有模型,其宽度排除了 group-128)的最可恢复层要好 21-52 个点,包括集中的 Qwen3-8B。我们报告了 2 个次要发现:残差是预算有限的(在我们跨 RTN、GPTQ 和 AWQ 的评估中,8 位几乎是无损的),并且峰值恢复的位置与系列内的架构相关,但与系列之间的架构无关。在此预算设置中,全局粒度是比选择性保护关键层更好的默认值。更广泛地说,与量化损伤相关的廉价信号不一定能确定恢复精度在哪些方面可以提高准确性;这必须通过因果干预来检验。