论文
鲁棒 LLM 针对重新学习攻击的忘却:表示中的次要组成部分很重要
Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter
摘要
大语言模型 (LLM) 消除学习旨在消除预训练模型中特定数据的影响,而无需进行昂贵的再训练,从而解决隐私、版权和安全问题。然而,最近的研究揭示了一个严重的漏洞:未学习的模型通过重新学习攻击快速恢复“遗忘”的知识。这种脆弱性引发了严重的安全问题,尤其是对于开放重量模型。在这项工作中,我们从表示几何的角度研究了这种脆弱性背后的基本机制。我们发现现有的忘却方法主要沿着主要成分进行优化,而次要成分基本上保持不变。重要的是,在重新学习攻击期间,这些主要成分的修改很容易被逆转,从而实现快速知识恢复,而次要成分对这种逆转表现出更强的抵抗力。我们进一步提供了理论分析,从表示的光谱结构中解释了这两种观察结果。基于这一见解,我们提出了次要成分遗忘(MCU),这是一种新颖的遗忘方法,明确针对表示中的次要成分。通过将遗忘效应集中在这些固有鲁棒的方向上,我们的方法显着提高了对再学习攻击的抵抗力。对三个数据集的广泛实验验证了我们的方法,证明了我们对最先进方法(包括清晰度感知最小化)的显着改进。