论文

RepSelect:通过表示选择性实现稳健的 LLM 遗忘

RepSelect: Robust LLM Unlearning via Representation Selectivity

模型训练模型编辑与遗忘

摘要

当 LLM 权重开放或 微调 可通过 API 获得时,抑制危险知识和倾向是不够的:移除必须足够深,以至于对手无法恢复它。按照这个标准,现有的遗忘是浅薄的:微调 或少数上下文中的示例会带回行为,并且通常会降低在此过程中的一般能力。我们确定了一个根本原因:现有方法编辑与保留集共享的表示,并且位于 微调 攻击者恢复的子空间中,使得忘记学习同时易于撤消和破坏。利用这一点,我们提出了 RepSelect(表示选择性),它通过在每次取消学习更新之前折叠权重梯度的顶部主成分来隔离遗忘集特定的表示,保留一般功能,同时限制 微调 可以恢复的内容。在涵盖知识(生物危害、网络、有关真实个体的事实)和倾向(辱骂、阿谀奉承)的五个遗忘数据集以及涵盖密集和专家混合架构的三个模型系列中,RepSelect 产生的再学习后答案概率比五个广泛使用的基线(GradDiff、NPO、SimNPO、RMU、UNDIAL)下降了 4-40 倍。它对于小样本提示也具有近乎完美的鲁棒性,并且能够承受旨在利用其机制的自适应攻击。我们的结果表明,遗忘需要有选择性地编辑哪些表征。