RePAIR:通过提示感知的模型修复实现交互式机器遗忘
RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair
摘要
大语言模型(LLM)在大规模网络语料预训练过程中不可避免地吸收有害知识、错误信息和个人数据,而原生机制无法对它们进行选择性移除。尽管机器遗忘提供了有原则的解决方案,但现有方法以服务提供方为中心,需要重训练管线、精心筛选的保留数据集以及模型服务提供商(MSP)的直接干预,从而将最终用户排除在对自身数据的控制之外。我们提出交互式机器遗忘(Interactive Machine Unlearning, IMU),一种用户可在推理时通过自然语言指示LLM遗忘特定知识的新范式。为实现IMU,我们提出RePAIR,一个提示感知的模型修复框架,包含:(i) 用于遗忘意图检测的看门狗模型;(ii) 用于生成修复流程的手术师模型;(iii) 参数被自主更新的患者模型。RePAIR的核心是我们开发的STAMP(Steering Through Activation Manipulation with PseudoInverse),一种免训练、单样本的遗忘方法,通过闭式伪逆更新将MLP激活重定向到拒绝子空间。其低秩变体将计算复杂度从O(d^3)降至O(r^3 + r^2 * d),实现高效的端侧遗忘,相比基于训练的基线最高提速约3倍。在有害知识抑制、错误信息纠正和个人数据擦除方面的大量实验表明,RePAIR实现了接近零的遗忘分数(Acc_f = 0.00, F-RL = 0.00),同时保持模型效用(Acc_r最高84.47, R-RL最高0.88),优于六个最先进基线。这些结果确立了RePAIR作为用户驱动模型编辑的有效且实用的框架,推动了对所学知识的透明化与端侧控制,并有潜力扩展到多模态基础模型。
