论文
语言学感知的非失真 LLM 水印
Linguistics-Aware Non-Distortionary LLM Watermarking
摘要
水印应识别语言模型输出,而不会降低质量或限制对模型提供者的验证。多语言部署使这变得更加困难,因为形态、分段和脚本会发生变化,而水印证据可以自然嵌入。我们介绍了 LUNA,一种语言自适应水印,它在标准随机密钥模型下将无模型检测与单词元无失真相结合。 LUNA 根据外部语料库中的词性上下文估计归一化的下一个标签熵,并使用它来设置非失真二进制锦标赛采样器的深度;检测器根据文本、分词器、标记器和密钥重建相同的时间表。我们根据八个主要基线在六种类型不同的语言和两个领域上评估 LUNA。在 12 种设置中,LUNA 的 AUROC 为 0.9959,平均绝对中位数困惑度偏移最低为 0.045;其 95% 自举区间 [0.022, 0.073] 低于所有基线区间。 LUNA 还记录了 Self-BLEU、Distinct-1、surprisal 和 entropy shifts 的最低平均值;它是唯一在大多数设置中同时实现 AUROC > 0.99 和绝对中值困惑度偏移低于 0.1 的方法,在 12 个设置中的 9 个设置中达到此状态,而没有基线在超过 2 个设置中达到此状态。我们的代码可在 https://github.com/Shinwoo-Park/luna_watermark 上获取。