论文

本机不可学习 大语言模型

Natively Unlearnable Large Language Models

模型训练模型编辑与遗忘

摘要

取消学习的目的是消除特定训练数据源的影响,但这已被证明具有挑战性,因为不同来源的贡献纠缠在模型中。隔离源对不相交参数的贡献使得删除变得更容易,尽管它阻碍了跨源的联合学习。我们提出了 NULL(Natively Unlearnable LLM),这是一个模型类,它通过训练一组共享骨干神经元以及一组稀疏激活的接收器来满足隔离源特定贡献和跨源联合学习这两个相反的目标。在训练期间,特定于源的信息自然地集中在其接收器中,而跨源共享的信息则累积在主干中。然后,通过禁用其相应的接收器,在部署时忘记源,没有梯度更新,也无法访问保留的数据。我们证明 NULL 可以扩展到维基百科的约 600 万篇文章,将每一篇文章隔离为独立的来源。取消学习单篇文章会删除特定于该文章的知识,同时保留与语义相关文章共享的事实,这与从头开始的再训练密切相关。我们注意到,用 NULL 进行的忘却也很稳健:在忘却《哈利·波特》书籍的案例研究中,NULL 既能抵抗对抗性提取,又能抵抗逆转事后忘却的重新学习。最后,NULL 保留了通用语言功能,与下游基准测试中的标准 Transformer 相匹配。总之,这些结果表明源级遗忘不必是事后才想到的。它可以原生构建到 LLM 训练中,同时保留共享表示学习的优势。