论文

诱饵方向优化:针对 LLM 取消的事后防御

Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration

模型训练模型编辑与遗忘

摘要

使用拒绝特征消除(RFA)可以轻松绕过开放权重语言模型中的安全护栏,RFA是一种从残余流中识别并投影出线性拒绝方向的技术,通常在保留模型能力的同时实现高攻击成功率(ASR)。防御这些攻击通常需要对每个新检查点进行计算成本高昂的安全微调。我们引入了诱饵方向优化(DDO),这是一种快速的事后权重编辑防御,不需要基础模型微调。我们的方法基于一个简单的机械洞察:消融攻击依靠对比估计器来找到拒绝方向。 DDO 不是试图隐藏真正的拒绝电路,而是主动向网络的 MLP 神经元注入高强度的非线性诱饵信号。当攻击者试图找到拒绝方向时,诱饵会破坏他们的估计器,诱骗他们消除无害的正交特征,而实际的安全机制保持不变。我们证明了这种效应形式化的频谱界限,并评估了六个模型系列的 DDO,在标准 RFA 下实现了 <10% ASR。在 Llama-3-8B-Instruct 上,DDO 仍然与自适应多阶段攻击下经过训练的防御相当(最坏情况 ASR 分别为 65% 与 58%),并将 Heretic 权重级攻击 ASR 从 88.7% 降低到 18%,每个配置的优化成本比经过训练的基线低 30 到 450 倍。