论文
通过程序存储器连续 微调 或 大语言模型
Continual Fine-Tuning of Large Language Models via Program Memory
摘要
参数高效的 微调 (PEFT),特别是低秩适应 (LoRA),已成为在有限计算下适应 大语言模型 (LLM) 的标准方法。然而,在使用小数据集顺序更新模型的连续环境中,传统的 LoRA 更新很难平衡快速适应和知识保留。现有方法通常将低秩空间视为同质更新区域,缺乏调节如何随时间整合短期更新的机制。受到神经科学中 \textbf{C} 补充 \textbf{L} 学习系统的启发,我们提出了一个具有 \textbf{Pro}gram 记忆的连续 LoRA 框架。我们的方法被称为 \textbf{ProCL},将 LoRA 适配器组织到结构化程序内存槽中,这些槽通过输入条件注意力动态检索。这可以实现快速和本地化的适应,鼓励类似的输入来重用共享适配器区域,同时为未来的数据保留未使用的容量。然后,这些槽与底层适配器相结合,后者维护分布式表示,逐渐积累跨任务的知识,以平衡可塑性和稳定性。我们的方法完全在 LoRA 参数化范围内运行,不会产生额外的推理成本。对不同基准的实验表明,与其他持续 LoRA 策略相比,保留率得到了提高,灾难性遗忘也减少了。