质量劣化约束下基于性能最大化的LLM量化层位宽分配方法
A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint
摘要
本文提出了 Gemma-3-1B 的层比特分配方法,将问题表述为给定退化预算约束(允许的生成质量损失水平)的性能最大化(延迟减少)。这种方法不同于文献中使用的耗时和资源消耗的均匀层量化方法(如 GPTQ 或 AWQ)或没有经过验证的性能加速效果的分配方法(如 MixLLM 或 TorchAO)。使用 TensorRT-LLM 内部的激活传递模式应用我们之前的工作 SA-PTQ 产生的层灵敏度配置文件。对于每层精度,根据之前步骤中引入的分组(5+5、10+10、all26)单独确定块,区分 FFN、Attention 和 lm_head 对整体加速的贡献。在 RTX 5090 上测量了 13 个 W8A8 变体的时钟速度。我们发现,对于 FFN 和 lm_head,量化/反量化的时间成本可以通过使用整数算术来补偿,而对于较短的上下文长度,Attention 的情况正好相反:额外的量化步骤会减慢执行速度。我们建议为 TensorRT-LLM 手动实现 SmoothQuant,这是必要的,因为导出失败,对于 lm_head 不可用。综合考虑所有三个标准后发现的最佳解决方案是带有 lm_head 的 FFN 5+5,延迟减少了 11.0%,质量损失可以忽略不计(Top-1 一致性为 98.90%,困惑度恶化0.85%)。在 FFN all26 + lm_head 的质量损失可接受的情况下,可以实现高达 19.1% 的加速。我们建议进一步优化:INT8 中的融合注意力内核、KV 缓存量化、使用 FP8 代替 INT8 以及类似于 FFN 的部分注意力量化。