论文

拒绝局部化,损害重新定位:少样本微调下的安全层

Refusal Localizes, the Damage Relocates: Safety Layers Under Few-Sample Fine-Tuning

模型评测安全与风险评测

摘要

微调使对齐的大语言模型 (LLM) 适应下游任务,但几十个有害示例可以消除它们对有害请求的拒绝。之前的工作将安全相关行为定位到特定的层、方向和词元,提出保护目标。我们测试成功的定位和恢复是否支持在攻击变化中幸存下来的防御。在四个模型系列的六个检查点中,有害和良性提示在攻击后保持线性可分离,并且将完全干净的隐藏状态修补到受损模型中可以在可重现的转换深度上恢复拒绝。在先前的层冻结防御的基础上,我们将每一层冻结到这个深度并重复攻击。在一百个有害示例中,所有六个检查点的拒绝率仍然接近于零,并且恢复过渡高于冻结边界。在第二项研究中,删除更新的前两个奇异方向可以在四个检查点上进行短暂的仅注意微调后恢复拒绝。在 Llama-3.1-8B 上,普通的训练更改会削弱这种修复,传播更新的攻击者会击败它。在良性 Llama 微调上校准的光谱探测器会错过该检查点上的大多数修复故障。然而,当一些有害示例无意中进入训练数据时,局部冻结可以帮助保留拒绝。这些结果表明,攻击者可以绕过恢复所识别的区域,并击败跨多个检查点的修复,从而激发针对自适应微调的防御的五次检查。代码可在 https://github.com/js-lee-AI/refusal-relocates. 获取