论文

LLM 真的会忘记吗?模型遗忘中的隐藏状态泄漏及其修复方法

Do LLMs Really Forget? Hidden-State Leakage in Model Unlearning and How to Fix it

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 中的忘却通常在输出级别进行评估,其中模型似乎抑制了敏感或不需要的内容。在这项工作中,我们表明这种评估可能会造成一种遗忘的错觉:即使消除了输出级泄漏,敏感信息仍可以编码在模型的隐藏表示中。我们首先提供理论分析,建立输出抑制和代表性擦除之间的根本区别。具体来说,我们表明解码器可以对敏感方向任意不敏感,将输出级泄漏驱动为零,而隐藏表示保留底层信息。为了凭经验验证这种现象,我们在Transformer层的隐藏状态上训练生成探针解码器,从而实现信息泄漏的分层测量。在三种广泛使用的基准测试(TOFU、MUSE 和 WMDP)以及最先进的遗忘方法中,我们发现大量敏感信息仍然可以从隐藏表示中恢复,即使标准输出级别指标表明遗忘成功。为了解决这一差距,我们提出了探测对抗表示抑制(PARS),这是一种不可学习的目标,可以对抗性地最小化隐藏表示中可提取的信息。 PARS 直接针对表征泄漏,并在对抗性探测和重新学习攻击下提供更强的擦除保证,优于所有评估的基线。我们的结果强调了现有遗忘范式的根本局限性,并表明大语言模型中的真正遗忘不仅需要控制模型输出,还需要控制隐藏表示中编码的信息。代码可在 https://github.com/OptimAI-Lab/HiddenStateUnlearning. 获取