论文

一个后缀即可破解所有这些:合并模型系列的盆地感知越狱

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

模型评测安全与风险评测

摘要

模型合并可以组合多个经过微调的模型,而无需额外的训练,但其安全影响仍然知之甚少。先前的工作主要将合并风险归因于不安全的组成模型,隐含地假设合并单独对齐的模型可以保持安全性。相比之下,我们表明模型合并揭示了先前被忽视的植根于预训练基础模型的越狱风险,即使所有组成模型都是单独安全对齐的。受这一观察的启发,我们研究了一种新的威胁设置,其中攻击者构造越狱提示,该提示可在共享相同预训练主干的合并模型中泛化,而无需访问确切的合并系数或组成检查点。为了利用这种现象,我们提出了 \textbf{Basin-Aware Jailbreak (BAJ)},它将越狱生成制定为合并空间上的最小-最大优化,以在合并模型系列之间生成可转移的对抗性后缀。跨不同主干网和合并设置的实验表明,BAJ 始终实现高传输成功率,并且在现有防御下仍然有效。