论文
REAL-Q:通过动态梯度下降进行 E2E LLM 量化
REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent
摘要
后训练 量化 (PTQ) 对于在严格的资源限制下部署 大语言模型 (LLM) 至关重要。最先进的 PTQ 方法使用单个封闭式二阶求解器对每一层进行量化:为了保持分析上的易处理性,它们高度近似全局损失(丢弃跨通道耦合,将输出行汇集到组中),然后冻结整个层上生成的 Hessian 矩阵,当损失情况逐列移动时无法刷新它,这种现象我们称为信息错位。我们提出了 REAL-Q(实时 E2E 损失对齐 LLM 量化),这是一种打破这种妥协的新颖 PTQ 范式:REAL-Q 不是为了分析的易处理性而稀释目标,而是以全局损失的端到端对齐替代为目标,并通过在每个列块(128 列)之后应用的细粒度、动态分块梯度下降对其进行细化。通过将这种细粒度校正与平滑跨层转换的滑动窗口机制相结合,REAL-Q 有效地减轻了网络中的错误传播。在 W4A16 的 LLaMA-3.1(8B 和 70B)和 Qwen3(0.6B-32B)上,相对于最先进的全局引导方法,REAL-Q 将端到端 KL 发散降低了约 49%。