论文
越受欢迎,越难忘记:LLM 遗忘的自适应流行度
The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning
摘要
与罕见事实相比,流行事实在预训练过程中记忆得更深入,并且抵抗去除的时间更长,但现有的 LLM 去学习方法无论训练数据频率如何,都会应用均匀的梯度压力。我们提出了 AdaPop(自适应流行度)方法,它将本地词元置信度与从外部代理(例如,维基数据站点链接、LLM-as-Judge)派生的实际流行度相关指数相结合,并通过双上升控制器自动执行忘记保留平衡,该控制器在每个时期调整保留惩罚。在三个模型系列和两个基准测试中,AdaPop 在释义查询下泄漏的遗忘内容比竞争方法少约 5 倍,在对抗性重构下泄漏约 1.6 倍。我们用内部指标支持我们的分析:在我们的方法下,遗忘集隐藏状态比其他方法更远离学习前模型的状态,而保留集表示仍然接近。