论文
单矩阵最优性还不够:低秩 LLM 压缩的三级优化
Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression
摘要
每矩阵奇异值分解 (SVD) 截断在白化 Frobenius 范数中是 Eckart-Young 最优的,但来自独立压缩矩阵的误差通过块的非线性前向传播而复合。部分受到量子多体方法中分层变分优化的启发,我们引入了一个三级链,将优化范围从单个矩阵扩大到 Transformer 块再到完整模型:白化 SVD~(L1)、块级联合优化~(L2) 和端到端语言建模损失细化~(L3),所有这些都来自 256 个校准序列,没有指令或恢复数据。在 LLaMA-7B 上,压缩率为 60% 时,该链将 WikiText-2 的复杂度从 42.1 降低到 19.1 再到 11.4。块级阶段充当正则化器:跳过它会使 Penn Treebank (PTB) 困惑度恶化 24 个点,这是我们实验中额外的端到端训练无法弥补的差距。尽管跨架构行使用特定于架构的配置,并且比率扫描不是在一种通用协议下运行,但在 20-80% 压缩、最多 13B 参数的五种架构以及分布内和分布外基准测试中,困惑度增益仍然存在。有了更多的校准数据,跳过块级阶段就变得具有竞争力,揭示了离线计算与数据的权衡。因此,我们声称仅在困惑度和压缩保真度方面有所改进;下游精度仍然远低于密集模型。