论文

通过梯度密封先发制人的大语言模型对禁止能力获取的学习

Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing

模型训练模型编辑与遗忘

摘要

开放式大语言模型不仅作为固定产品发布,而且作为下游微调的基础。然而,这种开放性会带来法律和道德风险,因为用户可能会滥用微调来灌输非法知识或进行敌对操作。因此,模型提供者需要针对此类获取进行预发布防御,从而引发先发制人的遗忘问题。与消除固定模型中已经存在的能力的回顾性遗忘不同,先发制人的遗忘旨在防止在未见过的攻击数据和未来的微调过程下获取这些能力。尽管具有实际重要性,但这种环境在很大程度上仍未被探索,带来了明显的挑战,因此是我们工作的核心焦点。我们首先验证现有的追溯方法提供的预发布保护是否不足。即使当前输出中禁止的功能被抑制,禁止域数据仍然可以通过内部路径产生梯度,从而实现以后的采集。受这一发现的启发,我们提出了一种梯度密封原理,通过将相关预激活推入负区域来阻止这些路径,其中 ReLU 家族激活表现出零或接近零的导数。跨多个大语言模型系列的实验表明,我们对下游采集的抵抗力比回顾性基线更强,验证了梯度密封作为预发布保护的有效机制。