论文

IO-SVD:用于自适应排序 LLM 压缩的输入输出白化 SVD

IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

模型优化模型压缩

摘要

大语言模型 在语言和推理任务中提供强大的性能,但其存储和计算成本仍然是在资源受限和延迟敏感的设置中部署的主要障碍。基于 SVD 的 后训练 压缩提供了一种与硬件无关的方法,可以通过低秩分解来减小模型大小并提高推理效率。然而,现有的方法通常依赖于仅输入的白化空间、同质排名分配或损失不可知的分配启发法,限制了它们在积极压缩下保持模型质量的能力。我们提出了输入输出白化 SVD (IO-SVD),这是一种 后训练 压缩方法,为模型权重形成 KL 感知的双面白化空间。使用 KL 损失在前 K 个词元概率上的二阶扩展,IO-SVD 构建了一个输出侧度量来捕获预测灵敏度,同时输入白化捕获激活统计数据。我们进一步引入了一种有效的异构排名分配策略,该策略使用一阶校准损失估计对白化奇异分量进行评分,并在全局预算下修剪最不敏感的分量。受先前将 SVD 截断与量化相结合的工作的启发,我们通过损失感知重新映射改进了混合 SVD 量化压缩,该重新映射根据量化所产生的预测损失变化选择低秩因子行进行 8 位量化。跨不同 LLM 和 VLM 系列的大量实验以及推理时间分析表明,IO-SVD 压缩 LLM 时性能下降最小,同时提供实用的推理加速。代码可在 https://github.com/mint-vu/IO-SVD.git 获取