论文

UnlearningSoup:大语言模型Unlearning需要反复调优吗?

UnlearningSoup: Is Repeated Tuning Necessary for Large Language Model Unlearning?

模型训练模型编辑与遗忘

摘要

在庞大的语料库上训练的大语言模型本身就有记住有害内容的风险,这些内容可能会在其输出中重新出现。为了缓解这个问题,现有的忘却方法通常依赖于基于训练的参数更新(例如梯度上升及其变体)来删除目标内容,同时保留其他知识。然而,平衡遗忘和保留的竞争目标使得这些方法的超参数选择特别困难,通常需要反复调整才能获得强大的模型,但该模型仍然留有很大的改进空间,并且在模型和数据集之间的传输很差。为了应对这一挑战,我们研究了遗忘运行是否在权重空间中表现出可利用的结构,并观察到来自不同运行的模型仍然位于共享的评估性能盆地中。这表明可以通过不学习的定制汤策略来恢复更强的模型,从而减少为进一步改进或新设置而重复调整的需要。受此启发,我们提出了 UnlearningSoup,一个提供两种策略的统一框架:EfficientSoup 使用基于二分搜索的插值在早期快速发现性能良好的模型,否则重复调优会使强模型选择成本高昂。 PerformanceSoup 使用重新加权的汤来有效地释放后期剩余的性能潜力,而重复的调优会变得越来越低效。跨不同数据集和模型的大量实验表明,UnlearningSoup 在超参数选择方面提供了 2.4 倍到 3.3 倍的效率提升,同时持续提高跨设置的性能。