论文

位移不是方向:评估量化 LLM 部署的保真度指标

Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

模型评测评测方法与指标

摘要

保真度指标,例如针对高精度参考的每个词元 KL 散度 (KLD),在实践中通常用作基准质量的低成本代理。我们在 Qwen3.6-35B-A3B 的 28 定量队列和 Devstral-Small-2-24B 的 41 定量队列上测试了这种做法,并通过一系列下游基准进行了评估。我们发现 KLD 与整个队列的基准分数密切相关(Qwen 上的 $ρ=-0.72$,Devstral 上的 $ρ=-0.86$,两者的 $p<0.001$)。然而,这种关系在接近基线的静默区中崩溃至不显着(Qwen 上的 $ρ=+0.00$ 和 Devstral 上的 $ρ=-0.24$、$p=0.36$)。这种崩溃在 14 个测量变体中持续存在,包括不同的 KLD 聚合、困惑度公式、top-1 一致性、校准语料库和上下文长度。在每个提示级别,KLD 对代码的失败预测能力很弱,LiveCodeBench 上五个模型的失败与通过的几何平均比率为 $[1.08,1.22]$,并且作为跨模型路由器失败,在不一致提示上仅实现 $42.3\%-49.4\%$ 准确度。我们将崩溃追溯到结构分解:KLD 主要测量与参考的分歧量,Qwen 上的静区复合 $ρ=+0.94$ ($p<0.001$) 和 Devstral 上的 $+0.55$ ($p=0.03$),而它与这些分歧方向的关系很弱并且是任务条件的。