论文

少即是多:LLM 的几何遗忘与最少的数据泄露

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

模型训练模型编辑与遗忘

摘要

随着 大语言模型 (LLM) 越来越多地部署在现实系统中,它们必须支持事后删除特定内容以满足隐私和治理要求。这会激发选择性遗忘,从而抑制有关特定实体或主题的信息,同时保留 LLM 的通用实用性。然而,大多数现有的 LLM 忘却方法需要访问原始训练语料库,并依赖于输出级拒绝调整或广泛的梯度更新,从而在忘却强度、非目标保留和数据可用性之间造成紧张。我们提出了几何取消学习(GU),一种直接对模型的提示条件隐藏状态进行操作的方法,无需访问原始训练语料库。具体来说,GU 从一小组安全参考提示中提取出一个紧凑的、低秩的安全行为子空间,并使用轻量级锚点上下文合成提示来触发隐藏表示与该安全子空间的局部、基于投影的对齐。合成非目标锚点上的教师 蒸馏 正则化器进一步减少了附带漂移。在面向隐私的忘却基准(ToFU 和 UnlearnPII)中,GU 实现了强大的目标抑制,同时对非目标性能的影响最小,这表明可以用最少的合成数据实现有效的忘却。