论文

从权重到特征:用于 LLM 持续学习的 SAE 引导激活正则化

From Weights to Features: SAE-Guided Activation Regularization for LLM Continual Learning

模型训练持续学习

摘要

权重空间正则化方法,例如弹性权重合并(EWC),是持续学习中灾难性遗忘的标准方法。然而,这些方法在应用于 大语言模型 时往往表现不佳。我们认为,这种表现不佳的部分原因可以通过 大语言模型 的“多语义”性质来解释:EWC 式正则化所使用的按权重重要性估计过于粗糙,无法隔离需要保护的知识。在本文中,我们建议在模型的激活空间中进行正则化,使用预训练的稀疏自动编码器(SAE)作为单语义特征字典。从约束优化的角度出发,我们推导了一种新的损失函数,该函数使用SAE特征字典来显式平衡稳定性和可塑性,并表明EWC是单侧权重空间惩罚设置中的一种特例。与存储或重新访问早期任务中的示例的基于重放的方法不同,我们的方法在掩码构建后不需要先前的任务数据:当前任务数据用于计算紧凑的 SAE 特征掩码,并且仅保留该掩码用于以后的训练。此外,由于特征空间的维数明显低于参数空间,因此所提出的方法具有更高的内存效率。在 TRACE 和 MedCL 持续学习基准上,该方法在没有引入特定于任务的架构组件的情况下取得了最强的结果,也超越了 EWC 等传统的权重空间正则化方法。除了性能比较之外,我们还为多语义论提供了经验证据:任务相关表示在 SAE 特征基础中是线性可分的,但与权重基础中的机会无法区分,并且权重空间保护在概念层面几乎是非选择性的。