CRMA:LLM 的模块化连续 微调 的频谱限制主干网
CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs
摘要
大语言模型 的顺序 微调 迫使我们做出选择:让共享基底继续学习并接受灾难性遗忘,或者在任务一之后将其冻结并排除跨任务细化。每任务适配器方法(LoRAHub、AdapterFusion、PackNet、Progressive Networks)采用第二条路径。我们引入了 CRMA(约束残差混合适配器),这是一种残差适配器,其内部混合矩阵 M 在通过 Sinkhorn 归一化的每次前向传递中都是双随机的,因此根据 Birkhoff 定理 ||M||_2 <= 1 通过构造成立 - 结构界限,而不是惩罚。 CRMA 的光谱边界骨干网提供了早期模块化方法无法提供的持续训练的共享基底,同时保留了其遗忘保证。在跨 5 个连续域和 3 个种子的 Mistral-7B 上,CRMA 主干上的模块化每任务 LoRA 将损失相关漂移从 +42.96% +/- 5.5(原始顺序 微调)减少到 -0.17% +/- 0.17,每种子范围不相交,并将先前任务保留损失比匹配的提高了 1.99% +/- 0.54冷冻基质基线。三个独立的实验设置(Mistral-7B 4 域控制消融、TinyLlama 3 域污染控制复制、Mistral-7B 7B 跨域探针)均显示出正向向后传输——无需重播缓冲区、无需增加每任务内存,也无需 蒸馏。 Gemma-2-9B 上的推理时间消融证实了 CRMA 介导了对顺序训练的知识的访问:在仅切换 CRMA 注入的情况下,在相同的权重和相同的问题上,98/100 与 38/100。 867 个记录的训练步骤验证 ||M||_2 = 1.0 在 float32 精度内(最大偏差 1.2 x 10^-7)。防遗忘效应适用于 1.1B-9.2B 参数和四个架构系列。