论文
训练过度,部署紧凑:扩展结构化 LLM 修剪的恢复能力
Train Overcomplete, Deploy Compact: Scaling Recovery Capacity for Structured LLM Pruning
摘要
大语言模型 在不同的任务中实现了强大的性能,但由于内存、延迟和能源需求,部署成本仍然很高。结构化修剪通过删除架构组件来降低这些成本,但其恢复阶段通常受到恢复模块的表示能力与删除知识的复杂性之间的不匹配的限制。我们将此瓶颈称为容量知识不对称,并提出了 OverRep,一种用于结构化 LLM 剪枝的过完备重参数化框架。遵循“训练超完备,部署紧凑”的原则,OverRep 在训练过程中暂时过度参数化恢复模块,以吸收从原始模型中提取的复杂知识。恢复后,过完备的重新参数化以代数方式合并到数学上等效的紧凑模块中,保留了修剪模型的推理时间架构和计算成本。 OverRep 进一步引入了退火激活,可以实现非线性训练动态,同时收敛到线性状态以实现精确的代数合并。在三个骨干系列中,OverRep 在 25% 和 50% 修剪的情况下,相对于强恢复基线,保留推理性能分别提高了 5.5 和 8.4 个点,同时保持内存使用和 TFLOP 与现有恢复方法相当。我们的代码可在 https://github.com/mmai-laboratory/OverRep 获取。