论文

先对齐再修正:极低位量化的两阶段低秩补偿

Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models

摘要

低秩量化误差补偿 (LQEC) 通过在每个冻结量化权重旁边附加一个封闭形式的等级 $r$ 适配器来恢复激进权重量化下损失的精度,而无需任何训练。我们表明现有的补偿器受到两个共同简化的限制。它们对称地校准,在同一激活上评估完整的 精度 和补偿权重,这会产生本质上是高等级的补偿目标 - 因此固定等级预算仅捕获其中的一小部分。尽管补偿模型不是平稳的,但它们仅最小化损失的二阶项:大于所应用的补偿本身的一阶下降方向保留在每一层中,并且没有重建目标可以吸收它。我们提出了一个两阶段的封闭式框架,消除了这两种简化。第 1 阶段将每一层的输出与费舍尔加权非对称目标下的完整 精度 模型对齐,将排名预算集中在排名可压缩目标上。第 2 阶段重新测量补偿模型的统计数据,并应用吸收剩余一阶信号的秩约束自然梯度步骤。每个适配器都是单个截断的 SVD 的结果;向后传递仅用于收集统计数据。在 QuIP# 下的 2 位下,我们的方法将 Qwen3-8B 上的 WikiText-2 困惑度从 12.43 降低到 10.26,将 Qwen3-4B 上的 WikiText-2 困惑度从 21.11 降低到 13.22。在 保留测试 C4 语料库上,它恢复了与 FP16 的 51% 和 84% 的差距,而最强基线的差距为 31% 和 63%,在更高的位宽和不同的量化器下,七任务零样本平均值具有一致的增益。

先对齐再修正:极低位量化的两阶段低秩补偿:论文原图
图 1:对称和不对称补偿目标的秩 $k$ 截断 $\big(\sum_{i=1}^{k}\sigma_{i}^{2}\big)\big/\big(\sum_{i=1}^{d}\sigma_{i}^{2}\big)$ 捕获的能量,其中 $\sigma_{i}$ 表示第 $i$ 奇异值,$d=\min(m,n)$ 表示。在 $k=64$ 处,非对称目标比对称目标捕获更多的能量,这表明固定排名预算在非对称目标下丢弃的信息更少。因此,非对称物镜本质上与低秩补偿更兼容。在 Qwen3-8B 中第 0 层的 mlp.down_proj 上计算,量化为 2 位,在 $8\times 2048=16{,}384$ WikiText-2 token 上校准。