论文

压缩保留不确定性吗?量化与剪枝LLM的统一基准

Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

模型评测鲁棒性、公平性与可信度评测

摘要

量化和剪枝等模型压缩技术被广泛用于降低大型语言模型(LLM)的部署成本,而现有的评估几乎完全集中在准确性保留上。然而,在安全关键型应用中,模型可靠地量化其自身不确定性的能力同样重要。我们问:压缩是否保留了这种能力?为了回答这个问题,我们在五个 NLP 任务的不同压缩配置下对 12 个大语言模型进行了基准测试,使用保形预测来提供严格的、无分布的不确定性测量。我们的实验表明:(I)压缩经常使准确性与不确定性脱钩; (II) 较大的模型比较小的模型更有效地吸收压缩引起的不确定性; (III) 不确定性通胀通常是阈值式的,而不是渐进的。这些结果表明,仅精度评估不足以评估压缩 LLM 的部署准备情况,并且不确定性感知基准测试应该成为模型压缩管道的标准组件。

压缩保留不确定性吗?量化与剪枝LLM的统一基准:论文配图
图 1:我们的基准测试概述。左图:具有相同精度的两个模型可能表现出截然不同的预测集大小,从而激发了超越精度的不确定性感知评估。中:基准管道 — 12 个大语言模型 (1B–70B) 通过四种范例进行压缩,并使用保形预测对五个 NLP 任务进行评估,产生三个互补指标。右图:我们的实验揭示了三个关键发现。