论文
GlowQ:量化 LLM 的组共享低秩近似
GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs
摘要
BitsAndBytes、AWQ 和 GPTQ 等量化技术被广泛用作部署 大语言模型 的标准方法,但在使用低位表示(例如 4 位)时通常会降低准确性。低秩校正方法(例如,LQER、QERA、ASER)已被提出来缓解此问题,但是,它们会恢复所有层并将纠错模块插入每个解码器块中,这会增加延迟和内存开销。为了解决这个限制,我们提出了 GlowQ,一种量化 LLM 的组共享低秩近似,它为每个输入共享组缓存单个共享右因子,并仅恢复产生最高准确度收益的组或层。 GlowQ 对每个输入共享组计算一次高精度投影,并在其模块中重复使用它,从而减少参数和内存开销,并保留特定于层的校正的表现力。我们还提出了一种选择性变体 GlowQ-S,它仅在提供最大好处的地方应用缓存共享模块。与强基线相比,我们的方法平均减少了 TTFB (5.6%) 并提高了吞吐量 (9.6%),同时将 WikiText-2 的困惑度降低了 (0.17%),并将下游准确性提高了 0.42 个百分点。选择性模型 GlowQ-S 进一步降低了延迟,将 TTFB 缩短了 (23.4%),并提高了吞吐量 (37.4%),同时将准确度平均保持在 0.2 个百分点以内。代码可在 https://github.com/ahnselim/GlowQ 获取。