论文

从持续学习中灾难性遗忘的角度重新思考后门对抗性遗忘

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

模型训练模型编辑与遗忘

摘要

现有研究表明,当前后门防御的稳健性有限,并且经常无法抵御特定类型的攻击。更令人担忧的是,流行的安全调整策略往往只提供表面的安全保护,因为它们无法完全消除后门效应。在这项工作中,我们从持续学习的角度提出了一种将后门学习和忘却作为一个连续的、三阶段过程的新颖表述。在此框架内,我们正式定义了完全后门遗忘,并基于灾难性遗忘机制进一步推导了实现完全后门遗忘的必要条件。在这些见解的指导下,我们提出了盲逆-后门对抗性遗忘(BI-BAU),它将满足遗忘条件的对抗性示例的生成表述为盲逆问题。我们通过将对抗训练的双层优化过程集成到期望最大化(EM)算法框架中来优化最大后验(MAP)目标来解决这个问题。此外,BI-BAU 还扩展到具有未知目标类别的非针对性对抗场景,以及多模态对比学习任务,增强了其对预训练模型可能受到损害的现实部署场景的适用性。大量的实验表明,我们的方法在广泛的后门攻击中表现出普遍的适用性,并且可以有效、彻底地消除后门模型的后门效应。