论文

后门遗忘泛化:去除 LLM 中未知触发器的途径

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 中的后门攻击是一个日益严重的安全问题,其中模型可以生成对手选择的内容。现有的防御措施一次只针对一个后门,并且通常需要了解触发器,当模型中可能存在未知的后门时,防御者就会处于结构性劣势。我们表明,通过遗忘来中和后门可以推广到后门:训练模型忽略单个触发器也可以抑制其他从未明确针对的后门。我们通过分析一次删除一个后门后获得的模型,研究了三个模型系列的这一现象,这些模型系列的后门是通过预训练或持续预训练注入的。为了理解为什么忘记某些后门会导致对其他后门的抑制,我们引入了交叉激活偏移距离,以量化不同训练引起的模型变化之间的距离。我们的结果为 LLM 安全开辟了新的方向,因为防御者可以故意注入受控后门,然后将其删除,利用跨后门传输来抑制攻击者之前可能在模型中引入的未知后门。