论文

Cascade:大型语言模型遗忘的分层可恢复性控制

Cascade: Hierarchical Recoverability Control for Large Language Model Unlearning

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 遗忘对于删除敏感或受版权保护的知识同时保留通用实用性至关重要。现有的方法通常会在中间表示中留下残留知识,但这些知识仍然可以恢复。为了解决这个问题,我们提出了 Cascade,一种分层可恢复性控制框架,可以最大限度地减少目标知识的内部可识别性。级联结合了三个互补的控制:用于抑制与隐私相关的激活路由的路径级路由、用于降低几何可分离性的表示级压缩以及用于限制残差恢复的解码级干预。 TOFU、MUSE-News 和 WMDP 上的实验(包括使用查询重构和提取式提示的稳健性测试)表明,Cascade 有效降低了可恢复性,同时保持稳定的模型效用。