论文
签名过滤:大语言模型 中统计水印检测的轻量级增强
Signature filtering: a lightweight enhancement for statistical watermark detection in large language models
摘要
统计水印可帮助组织对 大语言模型 (LLM) 输出进行归因,但当水印信号较弱、文本重复或水印被编辑时,现有检测器通常会遇到困难。我们提出了签名过滤,这是一种检测时模块,可以增强水印检测,而无需修改水印嵌入和文本生成。它学习一小组“签名”词元,这些词元的存在使水印测试不可靠,并在检测之前删除这些词元。签名是通过在小型训练集上求解混合整数线性程序来获得的,并具有最大化真阳性率的约束。我们还得出了几种攻击者模型(色盲、颜色自适应和分布相关)下的有限样本和渐近边界。在四个著名的水印系列(Kgw、Sweet、Unigram、Exp)、四个基准语料库(C4、MBPP、HumanEval、Code-Search-Net)和六个 LLM(Opt-1.3b、Opt-6.7b、Llama2-13b、Llama3.1-8b、Qwen2.5-14b、Phi-3-medium-14b)上, 2 克和 3 克签名将弱信号和低熵设置中的检测率从无过滤的 8~31% 提高到有过滤的 78~99%,同时保持误报可控且通常可以忽略不计。在压力测试中,我们通过稀释、删除和替换来打乱句子并扰乱 25~50% 的标记,Kgw 式水印的 2 克过滤器保留了大部分的纯文本检测增益,通常匹配或优于先进的 WinMax 水印检测器。因此,签名过滤提供了一个简单、可扩展且与模型无关的附加组件,以加强信息处理工作流程中对 LLM 文本的基于水印的来源检查。