论文

OpenStamp:开源语言模型的水印

OpenStamp: A Watermark for Open-Source Language Models

模型训练模型编辑与遗忘

摘要

随着 大语言模型 (LLM) 生成内容的日益流行,水印被认为是一种将文本归因于 LLM 并将其与人类编写的内容区分开来的有前途的方法。一类突出的技术通过修改词元采样概率在生成的文本中嵌入微妙但可检测的信号。然而,此类方法不适合开源模型,因为用户可以进行白盒访问,并且可以在推理过程中轻松禁用水印。在这项工作中,我们引入了 OpenStamp,一种水印技术,通过仅修改最终投影或非嵌入层,将水印逻辑直接编码到模型权重中。通过两个模型的实验,我们表明 OpenStamp 实现了卓越的检测性能,与之前的方法相比,模型能力的下降最小。植入的水印经过明确设计并经过经验证实,与之前的开源水印相比,对释义攻击更加稳健,并且更难以通过事后 微调 擦除。为了使开发人员能够为他们的模型添加水印,我们发布了我们的代码以及 4 个流行开源模型的水印版本。