论文
DurableUn:机器遗忘中的量化引发的恢复攻击
DurableUn: Quantization-Induced Recovery Attacks in Machine Unlearning
摘要
机器取消学习旨在删除指定的训练数据,以满足 GDPR 等隐私法规。然而,现有的评估假设取消学习和部署时的精度相同,而忽略了生产 LLM 是以低位精度部署的。我们证明,即使模型通过了 bfloat16 (BF16) 的合规性审计,INT4 量化也能系统地恢复被遗忘的内容,我们将其称为量化恢复攻击 (QRA)。我们对 NF4+LoRA 体系中适配器空间 INT4 量化下的遗忘鲁棒性进行了首次系统研究,评估了 LLaMA-3-8B-Instruct 上 TOFU、MUSE-News 和 WikiBio-WPU 的七种方法。 INT8 是良性的; INT4 导致恢复高达 22 倍,随着数据集难度的增加而恶化。我们发现了 FA-RA-Q-INT4 三难困境:没有一种方法可以同时实现强遗忘、高实用性和量化鲁棒性。一旦实现鲁棒性,密集的帕累托扫描就会显示出急剧的相变,无论进一步调整如何,保持精度都会崩溃。为了解决这个问题,我们提出了 DURABLEUN-SAF(锐度感知遗忘),这是一种通过 INT4 舍入使用直通估计器梯度的量化感知目标。 DURABLEUN-SAF 是实现稳定经验 (0.047, {BF16, INT8, INT4})-耐久性证书的唯一方法:Q-INT4= 0.043 +- 0.002,证书率= 3/3,而 SalUn 在其自己发布的超参数下的证书率= 1/3。我们呼吁将 Q-INT4 与 FA 和 RA 一起作为标准评估指标。