论文

LegoLM:大语言模型 的结构化权重共享

LegoLM: Structured Weight Sharing for Large Language Models

摘要

我们提出了 \LegoLM{},这是一种适用于 大语言模型 的结构化权重共享压缩框架,基于对全局权重共享失败原因以及解决方法的系统研究。我们确定了两种不同的故障模式。分布失配:对于维度 d <= 2 的向量块,具有异构权重尺度的 Transformer 层会施加尺度失配惩罚,该惩罚随 d 线性增长,并且无法通过增加 K 来解决,从而产生数百万的困惑。异常值优势:对于标量块,约 1/K 的权重分数超出最外层的 Lloyd-Max 决策阈值,无法由任何质心表示;他们的误传会跨层累积,导致灾难性的质量损失。 \LegoLM{} 通过三种无数据调整解决了这两种故障模式:1 标量块编码,以消除 $d$ 线性失配分量;2 百分位选择性替换,逐字识别和保留异常值权重;以及 3 对第一个和最后一个 Transformer 块进行边界层保护。在 GPT-2 小 (124M) 和 Mistral-7B 中,\LegoLM{} 在 Mistral-7B 上以 4.41 倍压缩时实现了 +0.03% 的 PPL 降级,在质量和压缩比方面均优于 PTQ-8bit,在 2.67 倍时实现了 -0.02% 的降级。 LAMBADA 和 HellaSwag 的下游评估证实,K=64、p=99% 时的 \LegoLM{} 在 5.12 倍压缩下保持了噪声内的精度,超过了 PTQ-8bit 的压缩比,同时匹配了其精度。我们进一步发现,异常值优势随着模型规模的增加而增长:K=128 时的完全替换仅使 GPT-2 降低 +23%,但 Mistral-7B 会灾难性地降低 +1,134,279%,而 p=99% 时的选择性替换将两个模型的性能降低到 +15% 以下。受控消融证实选择性替换是主要机制:将其添加到每层 K 均值中也能产生近乎无损的质量,与 \LegoLM{} 的匹配误差在 0.02% 以内。