论文

大语言模型 低秩分解的重要性引导基选择

Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models

摘要

低秩分解是压缩 大语言模型 的一种引人注目的方法,但其有效性取决于选择为目标任务保留哪些奇异向量基。巴塞尔等现有方法采用下游数据的奇异值系数,并用小的重新学习幅度修剪基数,这是一种可能与任务性能不一致的启发式方法,因为它忽略了损失景观的局部几何形状。我们提出了具有重要性的基础选择(BSI),这是一种有原则的低秩压缩框架,通过直接估计删除每个基础时产生的预期损失增加来对基础进行排名和修剪。 BSI 从任务损失相对于奇异值的二阶泰勒展开导出基于导数的重要性得分,结合一阶灵敏度和二阶曲率来量化修剪影响。为了使该标准适用于 LLM,我们通过将 Hutchinson 随机探测方法应用于具有对称参数扰动的损失曲率,开发了一种高效的 Hessian 对角估计器。我们提供全面的理论分析,包括基剪枝下的损失增加界限、Hessian 对角线估计误差到这些界限的显式传播、与 Hessian 谱相关的方差表征、实现目标估计精度的高概率样本复杂性保证以及扰动强度的指导。数学推理基准的大量实验表明,BSI 始终优于最先进的低秩分解基线,尤其是在深度压缩下有显着的改进。