论文
图引导的语言模型选择性遗忘:控制遗忘种子之外的支持路径
Graph-Guided Selective Unlearning for Language Models: Controlling Support Routes Beyond Forget Seeds
摘要
企业在专有数据上微调语言模型,这些数据日后可能因隐私、合同或合规义务而需要删除。选择性遗忘在保留模型效用的同时删除所要求的知识,为完全重训提供了实用的替代方案,但现有方法将显式标识的遗忘样本视为完整的删除范围。当目标知识仍可通过改写、别名或相邻训练样本恢复时,这就不够了。我们提出GRAPHSU,一个图引导的控制器,通过构建加权支持路径图、在其中传播删除压力并对高风险邻居施加分级遗忘强度,将删除范围扩展到遗忘种子之外。在合成作者档案问答基准TOFU(Task of Fictitious Unlearning)和围绕互联事实样本构建的结构化遗忘基准PISTOL上,使用GPT-2 Medium和Llama-3.2-3B-Instruct,GRAPHSU在所有删除设置中实现了效用可行条件下最低的软泄露,相较匹配的仅种子基线最多降低49.5个百分点的泄露,表明有效的企业级遗忘需要控制支持路径,而不仅是遗忘种子。
