论文

用于任务无关持续学习的稀疏子空间到专家共享

Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning

模型训练持续学习

摘要

大语言模型 (LLM) 中的持续学习受到可塑性-稳定性困境的阻碍,获取新能力往往会导致对先前知识的灾难性遗忘。现有方法通常统一处理参数,无法区分特定任务知识和共享能力。我们引入了用于任务无关持续学习的稀疏专家混合(SETA),该框架通过自适应稀疏子空间分解为特定于任务的专家模块来解决可塑性-稳定性冲突。与任务竞争相同参数的标准更新不同,SETA 将知识分为独特的专家和共享的专家,前者旨在隔离特定于任务的模式,后者负责捕获共同的特征。这种结构是通过自适应弹性锚定和路由感知正则化来维护的,它们共同保护权重和路由级别的共享知识,并使统一的门控网络能够在推理过程中自动检索正确的专家组合。跨不同领域特定基准的广泛实验表明,相对于最先进的持续学习基线,SETA 实现了具有竞争力或卓越的整体性能,特别是对早期任务知识的保留能力特别强,并且在 LLaMA-2 7B 和 Qwen3-4B 上改进了向后迁移。