论文

方差并不重要:跨模型尺度的 Transformer 压缩性的结构分析

Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales

模型优化模型压缩

摘要

我们通过对 GPT-2(124M 参数)和 Mistral 7B(7.24B 参数)进行 40 多次实验,对 Transformer 压缩进行了系统的实证研究。我们的分析涵盖频谱压缩、块级函数替换、基于旋转的量化、激活几何和自适应提前退出。我们确定了与压缩相关的五种结构特性。 (1) 方差并不重要:高方差激活方向与预测方向(通过 CCA 测量)大约 96% 不相关,并且投影到这些子空间上可以保留超过 90% 的方差,同时降低困惑度。 (2) 区块线性是有条件的:Transformer 区块仅在正确的上游分布下才近似线性(GPT-2 上的 R^2 ~ 0.95,Mistral 区块 31 上的 0.93);修改较早的块会引起分布变化,从而降低下游近似值。 (3)重构墙:将权重分解为量化分量的方法通过交叉项放大误差,使得直接量化严格优越。 (4) 线性随深度增加:Mistral 7B 表现出从 R^2 = 0.17(块 0)到 R^2 = 0.93(块 31)的进展,表明非线性特征构造和线性细化之间的划分。 (5) 大约 30% 的词元计算起来很容易,通过退出头和 KL 散度敏感性得到确认。我们证明,单块线性替换在 Mistral 7B 的最终块上实现了 34 倍压缩,困惑度增加了 1.71,而多块替换由于残余误差累积和分布偏移而失败。这些发现表明了静态 后训练 压缩的根本限制,并促使自适应、每个词元计算成为更有效的方向。