论文

遗忘的海市蜃楼:评估LLM遗忘的动态框架

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

模型评测评测方法与指标

摘要

大语言模型(LLM)的遗忘旨在增强安全、缓解偏见并遵守法律要求(如被遗忘权)。然而现有遗忘方法很脆弱:轻微的查询改动(如多跳推理与实体别名)即可找回本应遗忘的信息。因此当前评估指标常制造有效性的错觉——依赖静态、非结构化基准而无法发现这些漏洞。我们提出一个动态框架,用复杂结构化查询对遗忘鲁棒性做压力测试。该方法先从目标模型(遗忘前)引出知识并构建定向探针,从简单查询到多跳链条、可精确控制查询难度。实验表明该框架(1)通过自动生成语义等价的问答探针,覆盖度与现有基准相当;(2)与既有评估结论一致;(3)发现其他基准遗漏的新遗忘失败,尤其在高跳数场景。此外,激活分析显示单跳查询通常走主导计算路径,更易被遗忘方法破坏;而多跳查询倾向使用常保持完好的替代路径,解释了遗忘技术在多跳场景的脆弱性。该框架无需人工构建遗忘测试集即可实用且可扩展地评估遗忘方法,便于真实应用采用。我们在https://sites.google.com/view/unlearningmirage/home发布pip包与代码。

遗忘的海市蜃楼:评估LLM遗忘的动态框架:论文配图
图 1:我们的框架概述:我们的评估框架根据预学习模型输出构建知识图,从而能够自动生成结构化单跳、多跳和基于别名的查询。应用取消学习后,我们探索模型以评估剩余知识。该框架是动态的,可为任何实体实例化,并且是结构化的,可提供对查询复杂性的细粒度控制。