论文

超越单维压缩:大语言模型 的复合稀疏前沿

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

模型优化模型压缩

摘要

大语言模型 (LLM) 通常通过静态参数修剪或动态 词元级 计算进行压缩,但激进的稀疏化可能会触发超出基本稀疏边界的性能快速下降。这项工作询问\emph{结合这两种机制是否可以通过分配压缩负担来延迟这种退化}。我们研究了一种极简的复合稀疏框架,该框架首先应用低秩近似和通道修剪来获得静态压缩的主干,然后引入轻量级路由器用于每个词元动态层跳跃。该设计能够独立控制参数稀疏性和 词元级 计算稀疏性。跨语言理解和建模基准的实验表明,在相同的总稀疏性下,复合稀疏性始终优于单机制压缩,延迟了理解任务的衰减点并保持了更强的建模性能。进一步的分析揭示了参数剪枝和词元跳过之间的跨维度干扰,并表明在固定稀疏预算下接近平衡分配是最有效的。这些结果表明,复合压缩提供了一种改进 LLM 压缩的实用方法,同时揭示了最终限制进一步压缩的更广泛的跨维稀疏边界。代码可在 https://github.com/EIT-NLP/LLM-Pruning 获取。