论文
BARRIER:用于稳健信息擦除的有界激活区域
BARRIER: Bounded Activation Regions for Robust Information Erasure
摘要
机器取消学习的目的是从经过训练的模型中删除目标概念,同时保留其余知识。此设置的主要挑战是有效且稳健的擦除需要大量参数更新,这可能会无意中改变应保留的表示。因此,由于缺乏对中性概念保护的正式保证,现有方法常常以擦除强度为代价来换取保存。为了解决这个问题,我们提出了 BARRIER(用于鲁棒信息擦除的有界激活区域),这是一种通过在已识别的激活空间控制区域内驱动更新来实现更密集的遗忘的方法,其中可以在有限的附带退化的情况下执行目标擦除。使用区间算术,我们获得了保护区最坏情况表示变化的封闭形式界限,并将其用作知识保存目标。我们对这种保护及其对功能漂移的影响进行了正式分析。 BARRIER 是有原则的、与架构无关的,并且与现有的擦除目标兼容。实证评估表明,BARRIER 在分类和生成设置中实现了竞争性能,包括在某些情况下取得显着收益,同时保持了针对对抗性恢复攻击的强大鲁棒性。我们的代码可在 https://github.com/OneAndZero24/BARRIER 获取。