论文
改进稀疏内存微调
Improving Sparse Memory Finetuning
摘要
大语言模型 (LLM) 在训练后通常是静态的,但实际应用需要不断适应新知识而不降低现有功能。更新模型的标准方法,例如完全微调或参数高效方法(例如 LoRA),面临着一个基本的权衡:灾难性遗忘。它们修改共享的密集表示,导致任务之间的干扰。稀疏内存微调 (SMF) 通过将更新本地化到显式内存层中的一小部分参数,提供了一种有前途的替代方案。在这项工作中,我们提出了一个开源管道,用稀疏内存模块改造现有的预训练模型(Qwen-2.5-0.5B),从而能够在消费类硬件上进行有效的持续学习。我们通过引入基于 Kullback-Leibler (KL) 散度的理论基础槽选择机制来扩展先前的工作,该机制相对于背景分布优先考虑信息“令人惊讶”的词元的内存更新。我们的实验表明,我们改进的模型可以获取新的事实知识,同时对保留能力的遗忘最少,从而在实际环境中验证了稀疏更新假设。