论文
自回归模型中速度与质量权衡的量化考虑的层重要性度量
A Layer Importance Metric for Quantization Accounting for the Speed-Quality Trade-off in Autoregressive Models
摘要
小语言模型 (sLLM) 如今托管在内存和计算预算有限的设备上。在自回归设置中,推理受到内存带宽的限制:统一量化通常对此类模型不利,因为它们的架构冗余有限,并且只有少数层对较低精度不太敏感。我们提出了一个综合指标,结合了两个正交标准:信息保留(根据基于归一化 SQNR 的系数来衡量)和吞吐量增益(使用基于屋顶线的延迟分析进行建模)。通过分析 Gemma 3 1B,我们发现前馈网络块和嵌入矩阵是最有希望的加速目标。对于每个候选者,我们根据模拟量化估计归一化质量分数,并根据屋顶线建模估计归一化速度分数,无需实际执行。我们将两个分数合并为一个复合优先级系数,使我们能够根据需要调整速度和质量之间的权衡。我们的指标是通用的,可用于对各个块、其投影子层或 Transformer 层作为一个整体进行优先级排序。我们在几种模型架构上评估了我们的方法,结果表明我们的估计对加速加速的预测误差约为 4%。我们发现,与需要昂贵的近似推理的进化搜索、专用加速器或基于 Shapley 值的方法相比,我们的方法通常会为最具表现力的层分配更多的资源。我们的分析方法使 sLLM 量化成为一项可预测的工程任务。