论文
使开源文本 LLM 水印能够持久防止合并
Making Open-Source Text LLM Watermarks Durable Against Merging
摘要
开源 LLM (OSM) 正在达到接近最先进的性能,促使先前的工作通过将文本水印算法直接嵌入到其权重中来跟踪它们生成的文本。然而,OSM 会受到 后训练 修改的影响,该修改已被证明可以删除水印。特别是模型合并,这是一种用于结合专家知识和防止灾难性遗忘的重要方法,可以有效消除此类 OSM 水印。一个关键问题是如何使 OSM 水印能够在后续合并中幸存下来。在这项工作中,我们首次展示了如何设计持久抵抗模型合并的 OSM 水印。我们提出了合并对抗训练,这是一种对抗训练算法,可将文本水印提取为模型权重,同时对后续模型合并具有鲁棒性。我们的方法始终优于所有基线(例如,SLERP 高达 +51 个百分点 (pp),TPR@1%FPR 平均 +25 个百分点),同时保留下游能力。我们还首次根据实际合并场景评估 OSM 水印,代表常见用例,例如组合专家功能或防止灾难性遗忘,并使用 3 种著名的合并算法。更广泛地说,我们的研究结果表明,对抗性训练是提高 OSM 水印针对 后训练 修改的耐久性的可靠方法。