论文

在LLM中落实被遗忘权:面向政治敏感环境隐私合规部署的轻量级顺序遗忘框架

Operationalising the Right to be Forgotten in LLMs: A Lightweight Sequential Unlearning Framework for Privacy-Aligned Deployment in Politically Sensitive Environments

模型训练模型编辑与遗忘

摘要

大语言模型(LLM)越来越多地被部署在政治敏感环境中,其对个人数据或机密内容的记忆引发了GDPR及其被遗忘权等框架下的合规担忧。将此类法律原则转化为大规模生成系统面临重大技术挑战。我们提出一个轻量级顺序遗忘(sequential unlearning)框架,显式分离保留与抑制两类目标。该方法先通过正向微调稳定良性能力,再施加限定层级的负向微调以抑制指定的敏感模式,同时保持一般语言能力。在SemEval-2025 LLM遗忘基准上的实验表明,该方法实现了有效的行为抑制,对事实准确性与流畅性影响极小。GPT-2比DistilGPT-2表现出更强的鲁棒性,凸显了模型容量在隐私合规适配中的作用。我们将顺序遗忘定位为在政治环境部署的LLM中落实数据删除要求的一种实用且可复现的机制。

在LLM中落实被遗忘权:面向政治敏感环境隐私合规部署的轻量级顺序遗忘框架:论文配图
图 1:用于在大语言模型中实施“被遗忘权”的顺序遗忘框架。该模型首先通过对 Retain 数据集(良性知识)进行正向微调来稳定,然后对 Forget 数据集(敏感模式)进行层限制负向微调。通过将保留和抑制分为不同的优化阶段,该方法减少了梯度干扰,同时保留了一般语言能力并实现了隐私对齐的输出。