论文
通过激活感知初始化,大语言模型 的推理保留高效 蒸馏
Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization
摘要
高效的蒸馏(EDistill)通过结构化剪枝参数和调优轻量级模块来压缩大语言模型(LLM),训练效率高。尽管这些 EDistilled LLM 相对于类似大小的 LLM 在一般能力基准上实现了最先进的 (SOTA) 性能,但我们发现它们的多步推理能力严重退化,我们将其称为推理崩溃。我们系统地分析了推理崩溃的几何起源,并表明基于宽度缩减投影矩阵的 SOTA EDistill 方法会遭受 eRank 崩溃,其中隐藏表示的有效秩(eRank)下降。我们从理论上解释了随机初始化的投影矩阵的奇异值如何变得不均匀分布,从而导致 eRank 崩溃,从而导致词元不可区分。为了解决这个问题,我们为LLM提出了RED(Reasoning-preserved Efficient 蒸馏),它引入了激活感知初始化来将投影矩阵初始化为通道选择矩阵,从而理论上减轻了eRank崩溃。在 Llama 和 Qwen 系列上的实验表明,RED 在保持较高的训练效率和 SOTA 通用能力的同时,大幅恢复了推理能力。