论文

遗忘作为分布恢复:受控的反事实研究、经过验证的选择性筛选以及无 Oracle 认证的局限性

Unlearning as Distribution Restoration: A Controlled Counterfactual Study, a Validated Selective Screen, and the Limits of Oracle-Free Certification

模型评测评测方法与指标

摘要

机器遗忘通常是通过将重新训练的预言机与经过训练的探针进行匹配来评估的。在具有匹配的再训练参考的受控随机事实测试台中,我们发现该标准有利于保留保留知识的方法:它对保留保留知识的候选人进行了足够的评分,忘记事实$-2.82$ nat低于从未学习过的水平(集群CI $[-3.16,-2.48]$)。我们将遗忘重新定义为对跨越五个开放架构系列的 45 个模型种子单元的匹配参考和审计无预言机屏幕以及证书式标准的恢复。参考本身伪造了绝对保留/往返证书:通过构造保留保留集的注入模型在 41/45 单元中未达到固定保留阈值,在 31/45 中未达到其自身的往返阈值,而参考仅在 1/45 中完全认证。作为选择性的必要测试,基锚定的保留屏幕仍然很强大:在密封挑战套件上,它拒绝 45/45 单元中的注入模型,接受 44/45 中的参考,并部分检测实体路由抑制 (35/45);这是具有测量灵敏度的必要测试,而不是充分性证书。锚定到参考自身工作点的相对损伤重新校准可验证 15/45 单元中的一小部分;在它不放弃的地方,它的选择位于它优化的轴上的再训练噪声(0.80 nat)内,而常见的训练探针标准则位于 5.17 nat 之外(支持性比较,而不是面对面的基准)。固定幅度的 logits 抑制攻击会击败 12/45 单元的全套前向测试,因此仅前向认证并不健全;我们的方法是对所产生的方法的经验选择性测试。可识别性定理界定了哪些事实承认无预言机遗忘阈值,以 TOFU 作为预测的边界情况。