论文

论参数级防御对模型合并的脆弱性

On the Vulnerability of Parameter-Level Defenses to Model Merging

模型优化模型合并

摘要

无需训练 通过模型合并方式集成专家模型暴露了重大安全风险,使得搭便车者可以在未经授权的情况下组合专业模型。最近的工作提出了参数级防御,采用线性参数变换来消除这种威胁。在本文中,我们系统地分析了此类防御,并揭示了它们受保护的任务向量本质上规模很小。因此,受保护的权重仍然以预训练模型为主。基于这一观察,我们将预训练模型指定为静态参考锚点,并提出锚点引导攻击(AGA)来规避现有的防护措施。具体来说,AGA 将受保护的模型与该锚点对齐,以分析地恢复变换矩阵。广泛的评估验证了 AGA 在现实的防御不可知场景下始终能够绕过单独防御和复合防御。此外,我们还提供了 Anchor-Repulsive 微调 (ARF),这是一种缓解 AGA 利用的锚优势的防御方法。实证结果证实 ARF 有效地击败了所提出的攻击。我们的代码可在 https://github.com/krumpguo/secure-merge-attack 获取。