论文
从锚点到监督:大语言模型 记忆图引导的无语料库学习
From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models
摘要
大语言模型 (LLM) 可能会记住敏感或受版权保护的内容,从而引发严重的隐私和法律问题。虽然机器遗忘已成为一种潜在的补救措施,但普遍的范式依赖于用户提供的遗忘集,使得遗忘请求难以审核,并使系统面临二次泄漏和恶意滥用。我们提出了 MAGE,一种 Memory-grAph 引导擦除框架,用于用户最小化、无语料库的忘却。仅给定一个识别目标实体的轻量级用户锚,MAGE 探测目标 LLM 以恢复与目标相关的记忆,将其组织成加权本地内存图,并合成范围监督以进行忘却。 MAGE 与模型无关,可以插入标准的忘却方法,并且不需要访问原始训练语料库。在 TOFU 和 RWKU 两个基准上的实验表明,MAGE 的自生成监督实现了与外部参考生成的监督相当的有效忘却性能,同时保持了整体效用。这些结果支持由最小锚点而不是用户提供的遗忘语料库驱动的实用且可审核的遗忘工作流程。