论文
TULIP:有针对性的LLM在每个输入识别的层上进行遗忘
TULIP: Targeted LLM Unlearning at Layers Identified Per-Input
摘要
表征级别的遗忘会干预 LLM 的中间隐藏状态。尽管知识跨层分布,但现有方法在整个遗忘集的单个固定层上运行。我们问这样的固定层是否足够。为了回答这个问题,我们设计了一个劫持实验,将目标模型的隐藏状态移植到仅在保留集上训练的预言机中。预言机本身无法产生遗忘答案,但它会从嫁接状态产生答案。因此,答案是在中间层形成的,然后只是读出,所以遗忘应该集中于形成,而不是读出。此外,形成结束的层因输入而异。受这些发现的启发,我们提出了按输入识别层进行有针对性的遗忘(TULIP)。对于每个输入,TULIP 使用 logit 透镜来定位形成读出边界,并删除隐藏状态与那里的忘记答案的非嵌入向量的对齐。在 Llama、Qwen 和 Zephyr 模型中,TULIP 始终优于 TOFU、PISTOL 和 WMDP 的输出和表示级别基线。它还对释义和量化攻击保持鲁棒性。除了独立使用之外,它的每个输入层选择还可以作为即插即用组件,进一步改进现有方法。