论文
线性系综洗掉水印:论 LLM 中分布扰动的脆弱性
Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs
摘要
水印在人工智能生成的文本中嵌入统计签名以进行检测和归因。我们揭示了一个根本性的漏洞:当用户访问多个模型(当今的现实)时,水印几乎会失败。水印会扰乱输出分布,使其偏离原始分布,并且在竞争市场中,这些扰动通常在各个提供商之间是独立的。我们从理论上证明,平均输出概率分布可以恢复具有高达二阶误差项的无水印分布。根据经验,只需对 3-5 个模型进行平均即可消除这些扰动。我们引入了 WASH(通过统计混合进行水印衰减),它解决了集成生成中的实际挑战:异构模型之间的词汇不一致和标记化差异。六种水印方案和三种 LLM 的实验表明,对 3 个模型进行平均可以将检测 z 分数从 5-300 抑制到 2 以下(低于检测阈值 4),并将 5% FPR 下的 TPR 降低到 50% 以下,同时将质量提高 27.5%,运行速度比长序列生成的最佳基线快 6 倍。我们的结果表明,通过水印进行强大的人工智能文本检测需要接受这一基本漏洞,或者模型提供商之间进行前所未有的协调。