论文

SWAN:具有抽象含义表示的语义水印

SWAN: Semantic Watermarking with Abstract Meaning Representation

AI 基础设施AI安全与内容治理基础设施

摘要

我们介绍了 SWAN(具有抽象含义表示的语义水印),这是一种新颖的框架,它使用抽象含义表示(AMR)将水印签名嵌入到句子的语义结构中。现有的水印方法通常通过在文本生成过程中调整标记选择偏好来对签名进行编码,与之相比,SWAN 将签名直接嵌入到句子的语义表示中。由于签名是在语义结构级别进行编码的,因此任何保留含义的释义都会自动保留签名。 SWAN 是 无需训练:水印注入是通过提示 LLM 生成由选定的 AMR 模板引导的句子同时保持上下文连贯性来实现的,检测使用现成的 AMR 解析器,然后进行简单的单比例 z 测试。对 RealNews 基准的实证评估表明,SWAN 在未更改的水印文本上达到了最先进的检测性能,同时显着提高了针对释义的鲁棒性,与之前的方法相比,检测 AUC 提高了高达 13.9 个百分点。这些结果表明,SWAN 在 AMR 语义结构中锚定水印的方法为释义下的鲁棒文本来源验证提供了一种简单、有效且基于提示的方法,为语义级水印研究开辟了新途径。