论文
模型合并中的不对称坍缩:当拒答覆盖识别能力时
Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
摘要
模型合并常被用来在无需额外训练的情况下整合分别微调的模型能力,但标准合并方法能否同时保留多种与安全相关的行为尚不清楚。我们通过一项受控案例研究来考察这一问题:使用两个针对互补安全目标微调的Gemma-3-1B-IT模型——CARES危害等级分类与WildJailbreak对抗性拒答。我们使用Linear、SLERP、TIES和DARE-TIES合并这两个微调模型,并在分类准确率、抗攻击性和良性顺从度上评估合并后的模型。在全部四种方法中,抗攻击性的迁移都远好于分类准确率:合并模型保留81-85%的越狱拒答率,而CARES准确率最多只剩下12.9%。权重空间测量表明,这种不对称并非由强烈对立的任务向量方向造成:两个任务向量近乎正交(余弦相似度0.011)。相反,拒答微调诱导出一致更大的逐层任务向量幅度,使对幅度敏感的方法偏向拒答更新。这些结果表明,当安全相关的任务向量在规模上差异悬殊时,标准模型合并可能把安全识别坍缩为宽泛的拒答。
