论文

ICCU:经由模式诱导拒绝规则的上下文持续遗忘

ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules

上下文与知识上下文工程

摘要

机器遗忘(machine unlearning)旨在从训练好的语言模型中移除特定数据的影响。在真实部署中,遗忘请求往往相继到达,这对现有的基于微调的方法构成挑战:逐请求微调成本高、会累积效用损失,并可能引发跨请求干扰。为解决这些问题,我们提出ICCU(In-Context Continual Unlearning),一个上下文内的持续遗忘框架:它从遗忘数据集中归纳出可读的拒绝规则,并在推理时以过滤器或经由系统提示词的方式加以应用,而不修改模型参数。由于规则以与顺序无关的并集方式累积,ICCU具有可组合性且不存在跨请求干扰,原始遗忘集数据在规则归纳完成后即可丢弃。大量实验表明,ICCU能在保持效用的同时有效抑制目标知识,可随顺序请求扩展,并对改写与跨语言查询保持鲁棒。

ICCU:经由模式诱导拒绝规则的上下文持续遗忘:论文配图
图 1:ICCU 框架概述。第 1 阶段(持续拒绝规则生成)通过以下方式处理每个遗忘数据集 𝒟t\mathcal{D}_{t}:(1)对其样本进行聚类,(2)为每个集群引入一个自然语言拒绝规则,以及(3)将各轮的规则累积到共享存储库 ℛ\mathcal{R} 中。第 2 阶段(推理时间自适应规则检索)通过 (4) 集群门控处理每个查询 qq,当 qq 超出范围时直接回答 qq (davg>τd_{\text{avg}}>\tau); (5) 检索当 qq 在范围内时的 top-mm 规则 (davg≤τd_{\text{avg}}\leq\tau); (6) 将检索到的规则作为独立过滤器(基于过滤器的遗忘)或与答案生成联合应用(端到端遗忘)。