论文
从目标未学习模型中提取遗忘的提示
Extracting Forgotten Prompts from Targeted Unlearned Models
摘要
最近的遗忘方法(例如 NPO、DPO、LUNAR)利用拒绝对齐来抑制遗忘的数据。然而,事实证明,拒绝响应可能会留下遗忘的痕迹,并且最近的攻击已经能够成功地恢复一些未学习的知识。在本文中,我们发现了一个新的漏洞。现有的攻击通常假设对手已经知道被遗忘的提示,并专注于恢复他们的答案。然而,我们表明,可以通过使用保留的数据和对模型的黑盒访问来提取被遗忘的提示本身。我们的攻击,有针对性的主动搜索(TAS),首先通过构建规范模板和实体池来识别被遗忘的实体,并在有限的查询预算下使用信息最丰富的模板-实体对选择性地查询模型。一旦识别出实体,TAS 就会使用这些实体实例化提示模板,以探测未学习的模型并重建遗忘的提示。使用三个数据集和三个 LLM 进行的三种遗忘方法的实验表明,TAS 以 100\%$ 的准确度恢复了被遗忘的实体,并重建了高达 $95\%$ 的遗忘提示,同时比朴素探测少使用了高达 $99.7\%$ 的查询。