论文
Surgery:通过注意力汇聚缓解大语言模型有害微调
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
摘要
有害微调可使大语言模型的安全对齐失效,带来重大安全风险。本文利用注意力汇聚(attention sink)机制来缓解有害微调。具体而言,我们首先为每个注意力头测量一个名为sink divergence(汇聚散度)的统计量,并观察到不同注意力头呈现两种不同符号的sink divergence。为理解其安全含义,我们开展实验,发现在有害微调过程中,正sink divergence注意力头的数量随模型有害性的上升而增加。基于这一发现,我们提出可分sink divergence假设——微调中与学习有害模式相关的注意力头可按其sink divergence的符号加以区分。基于该假设,我们提出一种微调阶段的防御方法,命名为Surgery。Surgery利用一个抑制sink divergence的正则化器,将注意力头引导至负sink divergence一组,从而降低模型学习并放大有害模式的倾向。大量实验表明,Surgery在BeaverTails、HarmBench和SorryBench基准上分别将防御性能提升5.90%、11.25%和9.55%。源代码可在https://github.com/Lslland/Surgery获取。
