论文

压力测试遗忘算法

Stress Testing Unlearning Algorithms

模型评测基准与评测资源

摘要

最近,机器取消学习(即从模型中消除特定训练数据的影响)受到越来越多的关注。在 大语言模型 (LLM) 中,由于输入和输出的模糊性,遗忘尤其具有挑战性。因此,严格的评估对于评估安全性和实用性以及推动遗忘方法的进步至关重要。我们发现现有的未学习基准有两个关键缺点:(1)它们没有主动测试未学习的信息是否仍然可以被强制提取,(2)它们无法评估边界问题的性能保留,即在语义上接近未学习内容的良性查询。在这里,我们介绍 WMDP++,它是 WMDP 的扩展,它通过结合有针对性的未学习信息提取和对边界问题的系统评估来解决这些差距。 WMDP++ 为评估 LLM 中的遗忘提供了更严格、信息更丰富的基准。