论文
Nullify:零空间激活指导,用于免培训 LLM 忘却
Nullify: Null-Space Activation Steering for Training-Free LLM Unlearning
摘要
大型语言模型(LLM)在预训练期间不可避免地会内化大量敏感或私人信息,而 LLM 遗忘旨在有选择地删除特定知识,以防止隐私泄露,同时将模型效用损失降至最低。然而,现有的方法很难平衡遗忘质量和实用性,并且通常由于参数微调而产生大量的计算成本。为了解决这个问题,我们提出了 Nullify,一种用于 LLM 去学习的免训练、非破坏性激活控制方法。 Nullify 在推理过程中使用转向向量将与隐私相关的激活从其记忆的答案中重定向出来,同时满足零空间约束,使保留查询激活基本上不受影响以保持实用性。对 TOFU 和 MUSE 的评估表明,Nullify 在遗忘质量方面达到或超过既定基线,同时实现了模型效用的近乎无损保存。通过完全避免权重更新,Nullify 可以作为一种高效、即插即用的推理时间干预框架。