论文
重新利用对抗性扰动进行持续学习:从防御到主动调整
Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment
摘要
在动态环境中,大语言模型 需要不断适应新任务,但持续学习常常会遭受遗忘、迁移受限以及容易受到对抗性扰动的影响。为了解决这个问题,我们提出了 AdvCL,它将对抗性扰动重新用作几何控制信号,以实现稳定的持续适应。 AdvCL 结合了三个插件模块:Intra-Smooth 通过小的对抗性扰动提高局部平滑度; Proto-Clip 使用相似性裁剪来防止与当前任务原型过度对齐; Inter-Align 对先前的任务原型应用方向对齐,以减少表征差距。实验表明,标准性能和鲁棒性都得到了一致的提高,遗忘率更低,迁移能力更强。我们通过量化 Intra-Smooth 对扰动设置的敏感性以及 Inter-Align 对任务相似性和几何距离的影响来进一步分析关键机制。总之,这些模块在组合时可以提供互补的增益,并且每个模块还可以单独集成到不同的 CL 范式中,包括重放、正则化和动态架构,从而为持续学习提供几何控制机制。