论文

CertMark:保持生成分布的多比特水印与可靠解码

CertMark: Distortion-Free Multi-Bit Watermarking with Certified Decoding

AI 基础设施AI安全与内容治理基础设施

摘要

语言模型的领先多位水印方法通过偏置模型的下一个词元概率来编码消息,从而在消息恢复和文本质量之间建立权衡。他们的解码器通常会从累积的词元级证据中返回得分最高的候选者,而没有经过认证的弃权规则来限制输出错误消息的概率。我们介绍 CertMark,一种具有认证解码功能的保留分布的多位水印。 CertMark 没有修改概率,而是使用嵌入的消息来播种精确的 Gumbel-max 采样器,从而保留模型的原始采样分布。我们提出了两种可扩展的解码器:一个与模型无关的纯文本解码器和一个模型感知变体,该变体利用原始的下一个词元分布来实现更强的恢复。两者都支持经过认证的弃权,其返回错误消息的概率具有数学界限。在文本完成、摘要和故事生成方面,CertMark 可以匹配无水印文本的复杂性,同时可靠地恢复多位消息。模型感知解码器进一步实现了比概率偏置基线更高的位精度。我们的代码可在 https://github.com/Batorskq/CertMark. 上公开获取