论文

探索剪枝的局限性:特定任务神经元、模型崩溃和特定任务中的恢复 大语言模型

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

摘要

神经元修剪被广泛用于降低 大语言模型 的计算成本和参数足迹,但目前尚不清楚任务特定模型中的神经元是否对任务性能有统一的贡献。在这项工作中,我们通过对专门用于数学推理和代码生成的语言模型进行系统修剪研究,为任务特定神经元的存在和重要性提供了经验证据。我们引入了一种基于激活的选择性度量来识别对目标任务贡献较低的神经元,并在保持目标任务准确性的同时修剪它们,并将选择性修剪与随机修剪进行比较。选择性剪枝始终优于随机剪枝,这表明基于激活的选择性比随机剪枝具有系统优势。反向剪枝实验进一步表明,删除一小部分高度任务特异性神经元(~10%)会导致性能完全崩溃,这表明存在任务特异性神经元,并且关键任务信息集中在网络的一小部分中。相比之下,选择性修剪不太关键的神经元 (~30% - ~35%) 会降低准确性,但仍保留显着的性能。我们还观察到参数和运行时 VRAM 使用量持续减少,并且随着修剪的增加,推理吞吐量也有所提高。 1.5B 和 7B 模型的实验揭示了大约 15-20% 剪枝的鲁棒性阈值,超过该阈值,准确性损失和生成失败会急剧增加。 微调 显着恢复了跨剪枝级别的性能,特别是对于积极剪枝的模型。这些发现提供了神经元在特定任务语言模型中专门化的经验证据,并提供了对剪枝鲁棒性、模型冗余和剪枝后可恢复性的见解。