论文
CoCurve:用于结构化 LLM 剪枝的跨模块联合剪枝曲率
CoCurve: Cross-Module Co-Pruning Curvature for Structured LLM Pruning
摘要
当模型在固定内存和计算预算下扩展时,资源受限的部署需要维持 大语言模型 (LLM) 功能。结构化修剪通过较小的密集检查点推进了这一部署前沿,但决定修剪什么仍然受到联合删除之间相互作用的瓶颈。我们引入了跨模块联合剪枝曲率(CoCurve),它将结构化剪枝制定为对注意力头和前馈组的统一库存的依赖于集合的预测风险。从单单元前向消融构建的联合剪枝图将个体风险分配给节点,并将强化或取消分配给交互边,从而根据已删除的单元调整每个决策。我们跨 3 个困惑语料库、12 个语言任务和 7 个多模态基准评估了 6 个 LLM (3B--70B) 和 3 个视觉语言模型 (VLM)。在五模型 20--40% 网格和 70B 10--50% 扫描中,CoCurve 在 53/60 语料库比较中排名第一(70B 为 15/15);匹配质量插值允许在 9/10 的情况下增加 2.2--6.6 个剪枝点,而 CoCurve 领先于所有 6 个 VLM Avg$_7$ 块。在相同的轻量级恢复之后,其保留结构通过 50% 修剪仍然保持最强,其中 8B 检查点重新获得 10.8 Avg$_{12}$ 点;物理切片可提供 1.58倍的密集预填充吞吐量,峰值内存降低 41%。对 10 个 LLM 和 7 个 VLM 进行机制分析,发现有组织的模块内和跨模块边缘结构;匹配的低显着性、高耦合性删除会使 19/20 能力组降低高达 23.7 个百分点。