论文

经由缩放敏感损失景观使模型不可合并

Making Models Unmergeable via Scaling-Sensitive Loss Landscape

模型训练监督微调与指令调优

摘要

模型中心的兴起使得访问可重用模型组件变得更加容易,使模型合并成为组合功能的实用工具。然而,这种模块化也造成了\emph{治理差距}:下游用户可以将发布的权重重新组合成未经授权的混合物,从而绕过安全调整或许可条款。由于现有的防御措施主要是事后的和特定于架构的,因此它们在实践中跨不同的架构和发布格式提供了不一致的保护。为了弥补这一差距,我们提出了 \textsc{Trap}$^{2}$,这是一个与架构无关的保护框架,它在微调期间将保护编码到更新中,无论它们是作为适配器还是完整模型发布。 \textsc{Trap}$^{2}$ 不依赖于依赖于架构的方法,而是使用权重重新缩放作为合并过程的简单代理。它使释放的权重在独立使用中保持有效,但在合并时经常出现的重新缩放下会降低它们的性能,从而破坏未经授权的合并。

经由缩放敏感损失景观使模型不可合并
图1:模型共享中的不可合并性(Unmergeability)保护及以往工作的局限。(左) 提供方发布任务更新供下游复用,通常以 adapter 形式。(中) 大多数事后保护方法是 Transformer 专用的,限制了向 Transformer 之外的迁移。它们还需要完整权重访问,这使其与 LoRA 等 adapter-only 的发布不兼容。(右) 这些局限促使我们将训练时保护嵌入到所发布的更新中,在保持独立可用性的同时使下游合并变得不可靠。