论文
存储不是策略:LLM 遗忘的状态条件支持控制
Storage Is Not Strategy: State-Conditioned Support Control for LLM Unlearning
摘要
许多本地化大语言模型 (LLM) 去学习方法从本地化信号中选择一个小参数子集,并在优化过程中保持其固定。然而,与目标最相关的参数不一定是最适合更新的参数,并且候选干预措施可以随着优化的进行而改变值。在一项对照实验中,存储定位得分达到了 0.981 的接收者操作特征曲线 (AUROC) 下的面积,但存储身份仅与 17/36 的目标上的更好干预一致,而低秩适应 (LoRA) 则赢得了 35/36。我们引入了干预评分,它根据实际遗忘更新的预测效果对可编辑组进行排名,同时考虑附带损害,并用它来形成静态干预值基线(Static-IV)。然后,我们引入选择性动态干预重新排序(DIR-R),只有当校准探针证明比较合理时,它才会重新访问该子集。在 Natural-TOFU 数据集上,我们的方法在方法和目标之间的 19/20 比较中具有正的描述性裕度,尽管有一些接近于零。在 LACUNA 本地化精度基准上,我们的平均终端效用在所有六种负偏好优化 (NPO) 和 SimNPO 比较中都较高:NPO 利润范围为 +0.431 至 +0.848,SimNPO 利润范围为 +0.503 至 +0.571。梯度差 (GradDiff) 物镜揭示了显着的场依赖性。相对于 Static-IV,主要的四场 GradDiff 评估有 6 场胜利,6 场平局,没有损失,平均和中值成对增益为 +0.165 和 +0.0025。证据支持分离定位、初始干预选择和检查点依赖性支持修正。