论文
压缩保留不确定性吗?量化与剪枝LLM的统一基准
Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction
摘要
量化和剪枝等模型压缩技术被广泛用于降低大型语言模型(LLM)的部署成本,而现有的评估几乎完全集中在准确性保留上。然而,在安全关键型应用中,模型可靠地量化其自身不确定性的能力同样重要。我们问:压缩是否保留了这种能力?为了回答这个问题,我们在五个 NLP 任务的不同压缩配置下对 12 个大语言模型进行了基准测试,使用保形预测来提供严格的、无分布的不确定性测量。我们的实验表明:(I)压缩经常使准确性与不确定性脱钩; (II) 较大的模型比较小的模型更有效地吸收压缩引起的不确定性; (III) 不确定性通胀通常是阈值式的,而不是渐进的。这些结果表明,仅精度评估不足以评估压缩 LLM 的部署准备情况,并且不确定性感知基准测试应该成为模型压缩管道的标准组件。
