论文

Chainwash:对扩散语言模型水印的多步重写攻击

Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks

模型评测安全与风险评测

摘要

统计水印是验证文本是否由语言模型编写的常用方法。大多数现有方案都假设自回归生成,其中词元从左到右生成,并且上下文哈希被明确定义。扩散语言模型通过以任意顺序对标记进行去噪来生成文本,因此这些方案不能直接应用。 Gloaguen 等人最近的水印。 LLaDA 8B Instruct 弥补了这一差距,并报告真实阳性检测率高于 99%。本文研究了当水印文本被重写一次而不是多次时会发生什么。使用相同的水印配置,在五个 WaterBench 域中生成了 1,605 个带水印的完成,每个完成约 300 个词元。每个完成都由四个开放权重语言模型重写,从1.5B到8B参数,其中没有一个知道水印密钥。测试了五种重写风格:释义、人性化、简化、学术和总结扩展。每种风格最多链接 5 个跃点,总共生成 160,500 个重写文本。在标准显着性阈值下,87.9% 的原始输出检测到水印。单次重写后,检测率会下降到 14% 到 41% 之间,具体取决于重写者和风格。经过五次链式重写后,检测率下降至 4.86%,这意味着最初检测到的文本中 94.76% 不再被标记。经过 3 次重写后,检测器得分从其带水印的基线向零分布下降了 86%。因此,重复重写是比单次重写更强的攻击,并且结果适用于所有测试的四个重写器。