论文
响应指定大语言模型遗忘的零空间约束低秩适配
Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning
摘要
大型语言模型取消学习的目的是抑制指定的不需要的知识,同时保留良性的能力。许多遗忘目标侧重于抑制不需要的答案,而最近的目标引导变体指定了替换行为,但仍然使更新局部性在很大程度上不受约束。本文介绍了 \emph{Null-Space Constrained Response-Specified Unlearning} (NSRU),这是一种用于受控 LLM 取消学习的投影约束低秩框架。 NSRU 使用显式结构化的安全目标响应来指定每个忘记查询的所需行为,同时抑制原始不需要的内容。为了局部化适应,NSRU 根据良性隐藏表示估计每个模块保留子空间,并使用正交投影低秩参数化将 LoRA 更新限制到保留子空间的零空间。由此产生的目标在这种约束参数化下联合优化安全目标学习、不良响应抑制和保留保留。我们提供了本地一阶分析,表明预计的更新减少了保留侧扰动,同时保留了用于塑造忘记查询行为的可编辑方向。 TOFU 上的实验表明,NSRU 有效抑制了可提取的遗忘集知识,同时提高了保留 QA 性能、模型实用性和代表性基线上的安全目标对齐。在 WMDP 上,NSRU 将危险域精度保持在随机选择区域附近,同时保留广泛且与域相邻的 MMLU 实用性。消融研究支持安全目标监督、非期望响应抑制、保留损失和零空间预测更新的互补作用,而敏感性和鲁棒性分析表明在测试的超参数和提示变化中行为稳定。
