论文
Tripwire:通过统计认证的安全神经元触发对齐拒绝
Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
摘要
神经元与通路级干预为抵御大语言模型(LLM)越狱攻击提供了最细粒度的路径,但现有方法未兑现这一承诺,即它们往往显著损害模型效用。具体而言,一类工作通过抑制毒性神经元来抹除有害语义,但由于此类语义分布在整个网络中,阻断每条通路迫使干预足迹过大。另一类研究聚焦于用外部分类器识别安全神经元,虽有前景,但现有方法同样会损害对模型效用重要的神经元。此外,两类方法都始终处于开启状态,即使没有攻击也会扰动每个良性请求。为解决这些局限,我们提出Tripwire,一种免训练防御:首先在虚发现率(FDR)控制下通过逐神经元假设检验并配合效用特异性过滤器来识别安全专属神经元;基于这一识别,触发式钳位将所选神经元固定在其有害条件均值激活上,注入内部有害输入信号,从而触发对齐阶段习得的拒绝行为。该钳位通过两种可证明等价的部署模式实现,即检测器门控的推理时干预和离线偏置补丁权重编辑。在四个安全对齐LLM和四种代表性攻击上的大量实验表明,Tripwire将平均攻击成功率降至最高2.0%,同时在MT-Bench上仅带来0.5%至5.3%的效用下降,为所有防御中最小。代码发布于 https://anonymous.4open.science/r/Tripwire-65C4。
