论文

Brainstacks:通过冻结 MoE-LoRA 堆栈实现跨域认知能力,实现持续 LLM 学习

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

模型训练持续学习

摘要

我们提出了 Brainstacks,这是一种用于 大语言模型 的连续多域 微调 的模块化架构,它将领域专业知识打包为冻结适配器堆栈,在推理时在共享冻结基础上进行附加组合。五个互锁组件:(1) MoE-LoRA,具有 Shazeer 风格的噪声 top-2 路由,在 QLoRA 4 位量化和 rsLoRA 缩放下跨越所有七个 Transformer 投影; (2) 内部循环通过冻结经过训练的堆栈并添加新堆栈来执行剩余提升; (3) 外循环训练具有课程顺序依赖性的顺序特定领域堆栈; (4) 通过随机 SVD 进行零空间投影,将新堆栈约束到与先前方向正交的子空间,从而实现孤立的零遗忘; (5) 基于结果的 sigmoid 元路由器,根据经验发现的域组合目标进行训练,选择性地对堆栈进行权重,从而实现跨域组合。两个边界实验:(6)在随机初始化模型上进行PSN预训练; (7) 每域 RL (DPO/GRPO) 验证与 SFT 后对齐的兼容性。在 TinyLlama-1.1B(4 个域,9 个堆栈)和 Gemma 3 12B IT(5 个域,10 个堆栈)上进行验证,MoE-LoRA 的收敛速度比参数匹配的单个 LoRA 快 2.5 倍,残余升压突破了单堆栈上限,并且路由系统恢复了因非门控堆栈积累而破坏的生成质量。主要发现:基于结果的路由器发现领域堆栈编码可转移的认知原语(指令遵循清晰度、数字推理、程序逻辑、思维链结构)而不是特定领域的知识,在 97% 的情况下,医疗提示会路由到聊天+数学堆栈,尽管这些堆栈中的医疗数据为零。