论文
论LLM Unlearning中反事实知识训练的隐性成本
On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning
摘要
反事实调整(CFT)已成为 大语言模型(LLM)通过训练模型生成替代虚构知识来代替不需要的内容来忘却学习的有前途的范例。然而,在这项工作中,我们发现这种范式在某些方面仍然不如其他范式,并确定了这个差距背后的两个以前被忽视的陷阱:(1)知识冲突,反事实语料库中的相互不一致会导致梯度冲突,破坏参数优化;(2)幻觉溢出,拟合错误目标会灌输持久的制造偏差,从而增加不相关领域的幻觉率。为了系统地诊断这些问题,我们引入了 RWKU+,这是一种扩展基准,配备了新颖的权衡指标和梯度级诊断工具。我们的工作进一步讨论了该范式的局限性和开销,旨在为更严格的 LLM 忘却研究提供见解和可操作的指导。