论文
具有可证明的黑盒检测的数据集水印
Dataset Watermarking with Provable Black-Box Detection
摘要
大语言模型 (LLM) 通常是在大量松散管理的数据上进行预训练和后训练的,并且可能已经在专有数据集或用于评估的基准上进行了训练。这激发了数据集水印:设计数据集,以便对其进行训练,从而在生成的模型中留下可检测的签名。现有方法通过注入人工内容或在 词元级 生成控制下解释完整示例来嵌入水印,并且许多方法需要超出生成输出的模型访问以进行检测。我们的方法通过保留意义的本地编辑来增加随机选择的单词对的共现性,从而嵌入数据集级水印,并通过可证明的误报控制单独从生成的文本中检测到它。我们对四个基本模型和三个数据集进行了评估,结果表明它在 微调 阶段可靠地检测到水印($p <0.01$),优于现有的黑盒基线。我们的方法在大幅稀释的情况下仍然有效,其中水印数据少于 微调 词元的 5%。此外,我们的方法比现有基线更好地保留了基准实用性和语义完整性。