论文
持续 LLM 升级:用于从稠密到稀疏的预测器门控银行稀疏性训练方法 LLM
Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs
摘要
我们研究从稠密到稀疏的连续训练,作为从稠密检查点构造通道稀疏 大语言模型 的方法。从 Qwen2.5-8B 密集主干网络开始,我们继续在 32K 上下文中进行训练,并在 32K 阶段引入预测器门控稀疏 SwiGLU FFN。对于每个词元和层,我们使用低秩预测器来生成 FFN 通道路由 logits。然后,我们应用 Bank-wise top-k 规则在每个 64 通道组中保留 16 个通道,从而在 FFN 中间激活中产生 4 倍的稀疏性。与事后稀疏推理方法不同,路由模块放置在主要语言建模路径上,并在持续训练过程中进行优化,使密集模型能够升级为面向硬件的稀疏模型。我们报告架构、训练配方、基准性能和训练课程。我们还在 RULER-CWE 上识别了层局部长上下文故障模式,并提出了一种单层修复算法,可大大改善受影响的长度范围。