论文

学习神经网络压缩的函数子空间

Learning Functional Subspaces for Neural Network Compression

模型优化模型压缩

摘要

现代 Transformer 将令人印象深刻的功能与大量的内存和计算需求相结合。低秩权重分解可以减少两者,同时保持矩阵密集,从而在标准硬件上高效。然而,现有方法使用局部封闭形式标准选择要从每个权重矩阵中删除的子空间:激活能、逐层重建误差或损失的二次近似。这些标准忽略了错误如何通过网络传播,因此在高压缩下,错误与深度和性能崩溃相结合。我们引入了可学习子空间投影(LSP),它学习子空间以端到端地丢弃。每个线性层或读取相同激活的捆绑层组都被分配一个正交投影器。所有投影器都针对全局目标(密集模型输出分布的 KL 散度或模型的原始训练损失)进行联合优化,而预训练权重保持冻结。投影器从白化的 SVD 截断进行初始化,并通过每个投影器根据保存的参数导出的输出 KL 来分配等级。训练后,投影器合并为标准的低秩因子,每个捆绑组共享一个因子。在注意力中,这也让模型缓存一个狭窄的潜在变量来代替完整的键和值。在 LLM(OPT-125M/1.3B、Qwen3-4B、Llama-2-7B)和 ViT-B/16 中,LSP 优于基线,并且随着压缩的增加,其优势不断扩大。在 -70% 压缩时,LSP 使 Llama-2-7B 的 WikiText-2 困惑度达到 10.9,平均零样本准确度达到 42.2%,而最强基线的困惑度和平均零样本准确率分别为13.3和36.0%。在小批量大小下,因式分解模型的解码速度比密集模型快 1.6 倍,并且在 128k 词元上下文中,对共享潜在变量的处理将权重和 KV 缓存的组合内存缩小了 13.5 倍,而未绑定基线因式分解最多只能缩小 6.5 倍。