论文
MAAT:多阶段适配器感知有针对性的遗忘
MAAT: Multi-phase Adapter-Aware Targeted Unlearning
摘要
机器忘却评估在结构上存在偏差:探究因果和关系知识的“为什么”类型问题在 CounterFact 中所占比例不到 0.06%,在 ZSRE 中所占比例不到 0.6%,在 TOFU、MUSE 和 WMDP-Cyber 中所占比例不到 1.3%。这种接近于零的表示意味着在因果知识上失败的方法总体上可以得分很高,并且如果没有平衡评估,这种失败是无法检测到的。我们推出了 5WBENCH,这是一个平衡的 5,000 个样本基准,每个 5W 类别(人物、事件、时间、地点、原因)有 1,000 个示例,首次使因果遗忘失败得以量化。使用 5WBENCH,我们表明,没有任何现有基线能够同时在“为什么”类型的问题上实现高遗忘和高保留:激进的遗忘会降低保留的知识,而保守的方法无法忘记因果事实。 Why 类型的难度源于多跳推理链(Why 条目的 44%,其他条目小于或等于 2%)和 40.1-token 答案跨度的梯度稀释。我们提出了 MAAT(多阶段适配器感知有针对性的取消学习),这是一个在 LoRA 适配器权重上运行的三阶段框架,结合了梯度投影上升、SVD 等级维度修剪、任务向量否定和混合 KL 隐藏状态保留修复。 MAAT是第一个同时实现“为什么”型因果知识的高遗忘和高保留的方法,在遗忘-保留帕累托边界上达到了一个新的操作点。我们公开我们的代码。