论文

当技能遇到安全时:对技能合并的 LLM 的自适应越狱鲁棒性进行基准测试和表征

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

模型评测安全与风险评测

摘要

模型合并已成为无需重新训练即可赋予对齐语言模型新技能的默认方式:实践者使用任务算术、TIES 或 DARE 将来自数学、代码或领域专家的任务向量折叠到安全对齐的基础中。众所周知,这种便利会带来安全成本,但几乎所有证据都依赖于静态拒绝测试:固定的有害提示对合规性进行评分。我们认为这是一种误导。由于安全对齐是“浅层”的,集中在前几个生成的词元中,因此合并模型的静态拒绝可以保持干净,而真正的自适应攻击仍然会破坏它。我们引入了 SkillSafe-Bench,这是一个受控基准测试,可在保守的两位判断 AND 规则下对静态拒绝、自适应越狱鲁棒性和能力保留方面的技能合并模型进行评分。在六个开放权重基础(五个系列,两个尺度)中,静态安全性并不能预测攻击的鲁棒性:在语义模板攻击下,脆弱基础(Qwen 尺度和 Gemma)上看似安全的合并在 60-76% 的时间内被越狱,而其他基础(Llama、Phi-4)则保持鲁棒性。我们进一步证明了合并的静态效果是有基础条件的,通过无数据的几何信号(任务向量与安全子空间的重叠)来表征相同配方消除式安全侵蚀,并概述了 SubSafe-Merge,它将这种重叠投射出去,以消除保持能力下的侵蚀。对于合并的 LLM 来说,自适应评估不是可选的:最需要它的模型在静态筛选下看起来很安全。