论文

知识卸载:将 LLM 分解为稀疏骨干网和内存模块

Knowledge Offloading: Decomposing LLMs into Sparse Backbones and Memory Modules

模型优化稀疏化

摘要

LLM 将通用功能和特定领域的知识编码在一组参数中。我们询问这种能力是否可以重组:将广泛有用的计算保留在共享主干中,同时将专业知识转移到外部存储模块中。我们提出\emph{知识卸载}(KOFF),一个将预训练的 LLM 分解为稀疏共享主干和特定领域记忆的框架。从冻结的基本模型开始,我们共同学习结构化修剪掩码和轻量级恢复模块,作为 LoRA 适配器实现并学习键值缓存。在从 3B 到 8B 的 Llama 和 Qwen 模型中,我们发现可以将重要容量移出共享主干,而不会造成模型能力的大幅损失。在大约 12% 的全局稀疏度下,KOFF 保留了大部分未剪枝模型的性能,而在没有记忆的情况下剪枝相同的冻结模型会急剧下降。消融表明 LoRA 和学习到的 KV 记忆是互补的,专业化分析表明学习到的分解是有意义的:语言特定神经元被优先删除,而语言通用神经元大部分保留在主干中。这些结果表明知识可以在共享核心和可交换外部存储器之间重新分配。