论文

LFQ:提升低比特量化 LLM 生成质量的 Logit 感知末端块量化

LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

摘要

随着大语言模型不断扩展规模,低比特仅权重的训练后量化(PTQ)为其内存高效的部署提供了实用方案。尽管逐块 PTQ 在基础语言建模与理解任务上能够比肩全精度(FP)基线,但其在生成任务上的质量会下降——在更长的回复与更长的思维链上尤为明显,而这正是提升任务准确率的关键所在。我们将这一缺陷归因于两个因素:(i)逐块优化中忽略了未嵌入层(unembedding layer,即 LM head);(ii)依赖均方误差(MSE)目标。这两个因素都导致量化模型的 token 概率分布与 FP 模型错位,在文本生成基准上造成明显的准确率下降。为纠正这一偏差,我们提出 Logit 感知末端块量化(LFQ),这是对逐块 PTQ 的一种简单而有效的增强:通过最小化 FP 模型 logits 与其量化对应模型 logits 之间的交叉熵来量化最后一个 Transformer 块。通过在最后一个块中以 logit 层面对齐 token 概率,LFQ 在多个模型家族上持续提升复杂生成任务的准确率,超越最先进的逐块 PTQ,同时在语言建模与理解上与 FP 基线保持持平。

LFQ:提升低比特量化 LLM 生成质量的 Logit 感知末端块量化:论文配图
图 1:AIME 2024 问题 28 上贪婪解码下 L1-Qwen-7B-Max 的推理轨迹。我们比较 FP 基线、分块 PTQ(本图中的“blockPTQ”)和 LFQ(我们的)在两个时刻的标记级概率分布:(a) 分块 PTQ 的 top-1 标记偏离 FP 基线的第一步,以及 (b) 第一个“啊哈”引导推理走上正确道路的时刻。在(a)中,逐块PTQ的top-1(“这里”)对应于FP基线的top-2,产生错误的答案,而LFQ的top-1(“哪里”)与FP基线的top-1匹配,从而得到正确的答案。在 (b) 中,分块 PTQ 对“等待”过于自信,而对“但是”信心不足,而 LFQ 将概率分配给这些仍然更接近 FP 基线的“啊哈”标记。