论文

准确性还不够:基于散度的方法来评估量化 LLM 中的保真度损失

Accuracy is Not Enough: A Divergence-Based Approach to Evaluate Fidelity Loss in Quantized LLMs

模型评测评测方法与指标

摘要

在内存受限的边缘设备上部署 大语言模型 (LLM) 在很大程度上依赖于积极的 后训练 量化。然而,评估这些模型很大程度上基于零样本任务精度,这仅取决于 argmax 预测,并且对底层预测分布的变化不敏感。因此,精度在渐进量化下可能表现出不稳定、非单调的行为,掩盖了相对于 BFloat16 (BF16) 未压缩基本模型的大量保真度损失,并提供了误导性的部署信号。我们引入了一种分布敏感的评估框架,将量化 LLM 中的信息损失量化为词元决策边界处全词汇预测分布之间的分歧。我们计算全精度模型和量化模型的输出之间的统计距离,包括 Jensen-Shannon 散度和总变异距离,从而能够对分布偏移进行细粒度分析。使用此框架,我们量化相对于 BF16 参考的概率质量位移和分布漂移,捕获未反映在 top-1 精度中的预测分布变化。我们在渐进量化机制下,从未压缩的 BF16 到 Q2_K,在五个基础架构和四个推理基准上进行了 120 次运行的实验矩阵,提供了系统的保真度分析。我们的结果表明,在更强的量化下,发散指标通常会增加,从而通过保真度信号补充任务准确性。在经过测试的 llama-cpp 方案中,在相似的内存占用情况下,混合精度 Q4_K 通常会比均匀 Q4_0 产生更低的发散。这些发现激发了分布式感知评估作为任务准确性的实用诊断补充;它们不直接建立正确性、校准、安全性或用户感知的质量。