论文

LACUNA:评估 LLM Unlearning 定位精度的测试平台

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

模型评测基准与评测资源

摘要

LLM 会记住敏感的训练数据,包括个人身份信息 (PII),因此迫切需要可靠的事后删除方法。取消学习已成为一种有前景的解决方案,最先进的 (SOTA) 方法通常遵循针对特定模型参数的本地化第一、取消学习第二范式。然而,现有的基准仅在输出级别评估遗忘,从而留下了一个悬而未决的问题:遗忘是否真正从模型参数中删除了知识,或者只是混淆了它,重新浮现攻击的成功加剧了这一担忧。为了弥补这一差距,我们引入了 LACUNA:第一个具有 真值 参数级本地化的不可学习测试平台。 LACUNA 通过屏蔽持续预训练将合成个体的 PII 注入基于 1B 和 7B OLMo 的模型的预定义参数中,从而能够直接评估遗忘是否针对负责知识存储的权重。我们使用 LACUNA 对当前的 SOTA 去学习方法进行基准测试,发现尽管输出级性能很强,但现有方法非常不精确,并且容易受到重新表面攻击。我们进一步表明,当定位成功时,即使是简单的基于梯度的取消学习方法也能实现强大的擦除能力和对重铺攻击的鲁棒性,凸显了精确取消学习的重要性。我们发布 LACUNA 来补充行为评估,并推动基于本地化的稳健忘却学习的进一步发展。