论文
LLM真的能忘记吗?通过对抗性评估揭示遗忘差距
Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation
摘要
机器取消学习的目的是消除模型中目标训练数据的影响,同时保留其剩余功能,但评估此类信息是否真的变得无法访问仍然具有挑战性。现有的基准主要评估干净的、非对抗性查询下的遗忘情况,而似乎被遗忘的信息是否仍然可以通过战略提示来恢复尚不确定。我们通过使用 Llama-3.2-3B-Instruct 对 TOFU 上基于提示和基于 微调 的遗忘方法进行统一评估来解决这一差距,然后对在标准指标下表现强劲的方法进行对抗性鲁棒性评估。我们引入了攻击成功率 (ASR),这是一种 LLM 作为判断指标,用于衡量泄漏分数超过 0.2 美元的对抗性响应的比例,并评估八个攻击套件的恢复情况。我们的结果揭示了干净查询遗忘和对抗鲁棒性之间存在巨大差距。尽管几种基于 微调 的方法实现了高于 $0.91$ 的遗忘质量,但目标信息仍然可以恢复,ASR 介于 $72.8\%$ 和 $84.3\%$ 之间,接近未受保护的基本模型的 $87.5\%$ ASR。相比之下,干净的多语言重新配制仅产生 $2.95\%$ 的测量泄漏。手动审核进一步发现,十个案例中有七个二元 ASR 决策与人类事实评估之间存在一致性,这表明 ASR 提供了有用但不完美的行为可恢复性信号。这些发现表明,仅靠强大的标准指标表现不足以在忘却后建立稳健性,并不足以激发对抗性压力测试作为忘却评估的补充组成部分。