论文
先对齐再修正:极低位量化的两阶段低秩补偿
Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models
摘要
低秩量化误差补偿 (LQEC) 通过在每个冻结量化权重旁边附加一个封闭形式的等级 $r$ 适配器来恢复激进权重量化下损失的精度,而无需任何训练。我们表明现有的补偿器受到两个共同简化的限制。它们对称地校准,在同一激活上评估完整的 精度 和补偿权重,这会产生本质上是高等级的补偿目标 - 因此固定等级预算仅捕获其中的一小部分。尽管补偿模型不是平稳的,但它们仅最小化损失的二阶项:大于所应用的补偿本身的一阶下降方向保留在每一层中,并且没有重建目标可以吸收它。我们提出了一个两阶段的封闭式框架,消除了这两种简化。第 1 阶段将每一层的输出与费舍尔加权非对称目标下的完整 精度 模型对齐,将排名预算集中在排名可压缩目标上。第 2 阶段重新测量补偿模型的统计数据,并应用吸收剩余一阶信号的秩约束自然梯度步骤。每个适配器都是单个截断的 SVD 的结果;向后传递仅用于收集统计数据。在 QuIP# 下的 2 位下,我们的方法将 Qwen3-8B 上的 WikiText-2 困惑度从 12.43 降低到 10.26,将 Qwen3-4B 上的 WikiText-2 困惑度从 21.11 降低到 13.22。在 保留测试 C4 语料库上,它恢复了与 FP16 的 51% 和 84% 的差距,而最强基线的差距为 31% 和 63%,在更高的位宽和不同的量化器下,七任务零样本平均值具有一致的增益。
