论文

通过最大化再学习收敛延迟实现高效的忘却

Efficient Unlearning through Maximizing Relearning Convergence Delay

模型训练模型编辑与遗忘

摘要

机器取消学习给从预训练模型中删除错误标记、污染或有问题的数据带来了挑战。当前的忘却方法和评估指标仅关注模型预测,这限制了对模型真实底层数据特征的洞察。为了解决这个问题,我们引入了一种称为重新学习收敛延迟的新指标,它可以捕获权重空间和预测空间的变化,从而更全面地评估模型对遗忘数据集的理解。该指标可用于评估从未学习的模型中恢复被遗忘的数据的风​​险。基于此,我们提出了影响消除遗忘框架,该框架通过降低遗忘集的性能来消除遗忘集的影响,并结合权重衰减和向模型权重注入噪声,同时保持保留集的准确性。大量实验表明,我们的方法优于现有指标和我们提出的重新学习收敛延迟指标,接近理想的不学习性能。我们提供了理论保证,包括指数收敛和上限,以及在分类和生成性遗忘任务中强烈保留和抵抗再学习的经验证据。