论文

响应指定大语言模型遗忘的零空间约束低秩适配

Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning

模型训练模型编辑与遗忘

摘要

大型语言模型取消学习的目的是抑制指定的不需要的知识,同时保留良性的能力。许多遗忘目标侧重于抑制不需要的答案,而最近的目标引导变体指定了替换行为,但仍然使更新局部性在很大程度上不受约束。本文介绍了 \emph{Null-Space Constrained Response-Specified Unlearning} (NSRU),这是一种用于受控 LLM 取消学习的投影约束低秩框架。 NSRU 使用显式结构化的安全目标响应来指定每个忘记查询的所需行为,同时抑制原始不需要的内容。为了局部化适应,NSRU 根据良性隐藏表示估计每个模块保留子空间,并使用正交投影低秩参数化将 LoRA 更新限制到保留子空间的零空间。由此产生的目标在这种约束参数化下联合优化安全目标学习、不良响应抑制和保留保留。我们提供了本地一阶分析,表明预计的更新减少了保留侧扰动,同时保留了用于塑造忘记查询行为的可编辑方向。 TOFU 上的实验表明,NSRU 有效抑制了可提取的遗忘集知识,同时提高了保留 QA 性能、模型实用性和代表性基线上的安全目标对齐。在 WMDP 上,NSRU 将危险域精度保持在随机选择区域附近,同时保留广泛且与域相邻的 MMLU 实用性。消融研究支持安全目标监督、非期望响应抑制、保留损失和零空间预测更新的互补作用,而敏感性和鲁棒性分析表明在测试的超参数和提示变化中行为稳定。

响应指定大语言模型遗忘的零空间约束低秩适配:论文配图
图 3:NSRU 框架概述。 (a) NSRU 离线构建安全目标响应 y+y^{+} 并从 D~r\tilde{D}_{r} 估计保留子空间以获得 Pl=Ul​Ul⊤P_{l}=U_{l}U_{l}^{\top} 和 Pl⟂=I−PlP_{l}^{\perp}=I-P_{l}。 (b) 对于每个选定的可训练模块 l∈ℳl\in\mathcal{M},冻结路径生成 Wl​hlW_{l}h_{l},而零空间约束 LoRA 路径计算 Δ​Wl​hl\Delta W_{l}h_{l},其中 Δ​Wl=(αl/rl)​Bl​Al​Pl⟂\Delta W_{l}=(\alpha_{l}/r_{l})B_{l}A_{l}P_{l}^{\perp} 并且仅 Al,BlA_{l},B_{l} 可训练。 (c) 适应模型 θ′\theta^{\prime} 为忘记查询生成安全响应,并保留响应以保留查询ℒ=ℒ安全+λf​ℒ不需要的+λr​ℒret\mathcal{L}=\mathcal{L}_{\mathrm{安全}}+\lambda_{f}\mathcal{L}_{\mathrm{不需要的}}+\lambda_{r}\mathcal{L}_{\mathrm{ret}}。