论文
纠缠的表征会放大遗忘过程中的附带损害
Entangled Representations Amplify Collateral Damage in Unlearning
摘要
可解释性研究中长期以来的一个直觉是,表征纠缠(神经网络中知识领域之间的结构共享)使得忘却变得更加困难。虽然这种直觉很普遍,但它从未在受控实验中直接得到检验。我们提出了一种方法来做到这一点:通过重新利用选择性梯度掩蔽(SGTM),我们在英语维基百科上训练一套六个 254M 参数的语言模型,并在生物学和非生物学知识之间进行分级分离。将三种标准的去学习方法应用于套件中的每个模型,我们发现更加解缠结的模型始终能够实现更好的保留-忘记权衡:在固定的遗忘水平下,解缠结程度最高的模型在三种方法中的两种方法下,保留成本降低了大约 4 倍,在第三种方法中,保留成本降低了 1.3 倍。因为我们的干预仅改变模型,而不是数据或遗忘算法,所以这是直接证据,表明表征纠缠是遗忘过程中附带损害的原因之一,正如可解释性研究人员长期以来所怀疑的那样。类似的设计可用于测试其他结构声明的可解释性。