论文

RDQ:大语言模型 的残差分布量化

RDQ: Residual Distribution Quantization for Large Language Models

摘要

大语言模型 的 后训练 量化 (PTQ) 急剧下降到低于 4 位精度。我们将根本原因确定为残差流分布漂移:在每个 Transformer 层注入的量化噪声在共享残差表示中累积,导致 FP16 基线的 KL 散度随深度超线性增长(Pearson r=0.999,对数困惑度,p<0.001,在所有测试方法和位宽中得到证实)。我们发现 84% 的 LLaMA-3-8B 层表现出非高斯残差分布(KS 测试,p<=0.05),并且每层残差流方差在深度上增长了 6,548 倍。我们提出了 RDQ(残差分布量化),这是一个 PTQ 框架,其核心贡献是级联误差补偿(CEC):一种顺序校准程序,捕获每层接收的实际漂移激活(通过通过已量化的上游层运行校准数据来计算),并根据这些漂移输入拟合每通道 AWQ 式尺度,并将尺度折叠到前面的 RMSNorm 权重中,以在零推理开销下实现精确的数学等价。 RDQ 在所有三种测试架构上均取得了最先进的结果: LLaMA-3-8B:7.55 / 5.62 PPL (W3/W4); Qwen-2.5-7B:7.46 / 6.38 PPL; Mistral-7B:6.88 / 5.73 PPL。 RDQ 在每个模型和位宽组合上都击败了最佳已发布基线(LeanQuant/SpinQuant),在 LLaMA-3-8B 上的 W3A16 上与 RTN 相比,增益高达 -46.4%。所有输出都是标准的 group-128 非对称量化,可在零运行时开销的情况下部署在 Qualcomm AIMET、GGUF 和任何标准推理堆栈上。