论文
超级调优:从激活感知修剪到稀疏 微调
Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning
摘要
大语言模型 (LLM) 的微调成本仍然很高,因为全参数更新需要大量内存、计算和每个任务存储。我们研究最初为修剪而开发的显着性信号是否可以重复使用来选择模型应该适应的地方。我们提出了 Super,一种稀疏参数高效的 微调 (PEFT) 方法,该方法使用从校准过程中计算出的 Wanda 式激活加权幅度得分 [Sun et al., 2023] 来修复小型可训练支持。然后,我们介绍 Supra,这是一种混合适配器,它将这种稀疏更新与 LoRA 结合起来,同时通过简单的预算分割规则保留匹配的可训练参数预算。在 Llama-3.2-1B 和 Meta-Llama-3-8B 上的单种子 Math17K 算术实验中,最好的 Super/Supra 变体在测试的计划选择的适配器配置中实现了最高的平均精度。我们还包括 PaFi 风格的仅幅度支持作为最接近的 无需训练 稀疏基线,并发现在幅度和 Wanda 风格排序下的低分支持都是有效的。这些结果表明,简单的剪枝排序可以为 PEFT 提供有用的固定稀疏支持,特别是与低秩适配器结合使用时。