论文

QSS:用量化充分统计实现精确内容遗忘

Exact Unlearning via Quantized Sufficient Statistics

模型训练模型编辑与遗忘

摘要

精确遗忘要求已部署预测器与在不含删除请求指定信息的数据上重建的预测器一致。现有通用精确方法用互不重叠的分片局部重训,但每次请求仍使一个模型失效,较小分片也减少各组成预测器可用的数据。Quantized Sufficient Statistics(QSS)把小型冻结模式与可变、可加性分解的内容分开。模式学习全局结构,内容以量化区域索引的可加统计量保存局部预测修正,因此删除内容是精确减法而非优化。QSS-L精确移除标签但保留无标签输入;QSS-E在不含可删除样本的数据上学习模式,精确移除输入与标签。一次删除以概率 $1-ρ$ 走算术快速路径,以概率 $ρ$ 触发完整重建;所有预期延迟均计入两种事件。在 $ρ=0.5\%$ 的15个视觉、文本和表格数据集上,QSS-L在11项任务中与SISA相差不超过2个百分点,在紧凑模式有效的低类别数任务中,预期删除延迟低4—483倍。QSS-E量化移除输入每条痕迹所增加的准确率代价。

QSS:用量化充分统计实现精确内容遗忘:论文原图
图 20:测试集嵌入的 UMAP 预测,以 0 级细胞纯度(每个细胞属于多数类的分数)进行阴影表示。深色区域表示纯细胞($>$90%);浅色区域表示混合细胞。 MNIST(平均纯度为 96.6%)实现了最小的 QSS-L–SISA 差距 ($+3.8$ pp); Covertype (63.1%) 在低 $k$ 任务中拥有最大的数量 ($-10.7$ pp)。