论文

SCALPEL:用对比稀疏自编码器定位细粒度遗忘特征

Neuralyzing the Trace: Selective Representation-Level Unlearning with Contrastive Sparse Autoencoders

模型训练模型编辑与遗忘

摘要

机器遗忘的目的是删除目标信息,同时保留模型的其他能力。在现实环境中,例如欧盟 GDPR 下的隐私请求,目标可能很窄,例如与单个人相关的信息。仅仅行为遗忘可能是不够的,需要直接对内部表征进行干预。然而,标准的机制可解释性提取器对此类目标的选择性较差。我们在基于重建的提取中发现了能量偏差,该偏差有利于占主导地位的背景结构而不是低能量目标特定成分。我们引入了 SCALPEL,一种对比稀疏自动编码器,旨在学习更具选择性的遗忘特征。我们从理论上证明,对比训练可以促进目标选择性特征,并且我们的选择分数可以控制预期的背景知识扰动。我们在 Qwen、Llama 和 Gemma 的 TOFU 上对 SCALPEL 进行了实验验证,它比 NMF 和标准 SAE 干预措施有了显着改进,并且与梯度差和 RMU 具有竞争力,桥接了机制可解释性和细粒度遗忘。

SCALPEL通过多视图、激活缓存、对比稀疏自编码器及特征干预进行定向遗忘。
图1(图注摘要):SCALPEL通过多视图、激活缓存、对比稀疏自编码器及特征干预进行定向遗忘。