论文
遗忘的海市蜃楼:评估LLM遗忘的动态框架
The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning
摘要
大语言模型(LLM)的遗忘旨在增强安全、缓解偏见并遵守法律要求(如被遗忘权)。然而现有遗忘方法很脆弱:轻微的查询改动(如多跳推理与实体别名)即可找回本应遗忘的信息。因此当前评估指标常制造有效性的错觉——依赖静态、非结构化基准而无法发现这些漏洞。我们提出一个动态框架,用复杂结构化查询对遗忘鲁棒性做压力测试。该方法先从目标模型(遗忘前)引出知识并构建定向探针,从简单查询到多跳链条、可精确控制查询难度。实验表明该框架(1)通过自动生成语义等价的问答探针,覆盖度与现有基准相当;(2)与既有评估结论一致;(3)发现其他基准遗漏的新遗忘失败,尤其在高跳数场景。此外,激活分析显示单跳查询通常走主导计算路径,更易被遗忘方法破坏;而多跳查询倾向使用常保持完好的替代路径,解释了遗忘技术在多跳场景的脆弱性。该框架无需人工构建遗忘测试集即可实用且可扩展地评估遗忘方法,便于真实应用采用。我们在https://sites.google.com/view/unlearningmirage/home发布pip包与代码。
