论文
PatchBench:评估大模型安全修复的局部误伤
PatchBench: Measuring Collateral Damage in Activation Patching
摘要
LLM 安全补丁可以通过基准测试,但仍然是一个糟糕的修复。对于越狱修复来说,这种风险尤其严重,其目标是纠正特定的不安全行为而不改变不相关的行为。补丁可能会阻止精确的评估提示,但在接近的有害变体上失败,或者通过过度拒绝共享其措辞或结构的良性提示来抑制有害行为。现有协议主要测试模型是否可以被破坏,而聚合指标(攻击成功率、拒绝率、全局能力)无法区分选择性修复和更广泛的局部抑制。为了解决这一差距,我们引入了 PatchBench,这是一个根据经验观察到的特定模型越狱失败的基准,从而产生可操作的有害答案。从 37 个公共数据集的 27,870 个提示开始,我们整理了 15,314 个英语提示并查询 8 个开源指令调整模型。结合 WildGuard 过滤、成对 Elo 排名和手动验证,我们保留了 400 个高可信度越狱失败的精选库。我们进一步介绍PatchBench-Local,一个评测 协议测试补丁是否行为精确。对于每个有害源提示,PatchBench-Local 都会生成三个本地邻居系列:保留恶意意图的有害变体、具有匹配结构的良性提示以及重用关键有害术语的良性提示。它评估有害邻居纠正和良性邻居保留,区分选择性修复和更广泛的局部抑制。使用 PatchBench-Local 和 MMLU 评估四种激活控制方法表明,全局能力几乎保持不变,而局部良性回归很严重,从而确认了聚合指标遗漏了重要的附带损害。 PatchBench-Local为开发和比较越狱修复方法提供了更精确的基础。