论文
通过激活补丁测量 LLM 遗忘的深度
Measuring the Depth of LLM Unlearning via Activation Patching
摘要
大语言模型(LLM)遗忘已成为隐私保护和人工智能安全的重要事后机制,但审计目标知识是否真正被删除仍然具有挑战性。现有的输出级指标无法检测何时可以从内部表示中恢复这些知识。最近的白盒研究揭示了此类残留知识,但通常依赖于辅助训练或特定于数据集的适应,没有留下可推广的指标。我们通过取消学习深度得分(UDS)缩小了这一差距,该指标通过激活修补来量化取消学习的机械深度。 UDS 首先使用保留模型基线识别对目标知识进行编码的层,然后按 0-1 等级测量未学习模型中删除了多少知识。在对涵盖 8 种方法的 150 个未学习模型的 20 个指标进行的元评估中,UDS 实现了最高的 忠实性 和鲁棒性,证实我们的因果方法是最可靠的遗忘评估方法。案例研究进一步表明,UDS 揭示了因表征转变而被观测指标掩盖的残留知识,且擦除深度因提示类型而异。我们提供将 UDS 集成到现有基准测试框架并简化评估流程的指南。代码和数据可在 https://github.com/gnueaj/unlearning-depth-score 获取。