论文

SLAM:语言模型的结构语言激活标记

SLAM: Structural Linguistic Activation Marking for Language Models

模型评测安全与风险评测

摘要

LLM 水印必须能够在不影响文本质量的情况下被检测到,但大多数现有方案都会使下一个词元分布产生偏差,并以可测量的质量损失来支付检测费用。我们提出了 SLAM(结构语言激活标记),这是一种新颖的白盒水印方案,通过将标记写入结构几何而不是标记频率来避免这种成本:稀疏自动编码器识别编码语言结构(例如语音、时态、子句顺序)的残余流方向,并且我们在生成时因果地引导这些方向,使词汇采样和语义不受约束。在 Gemma-2 2B 和 9B 上,SLAM 实现了 100% 的检测准确性,质量成本仅为 1-2 个奖励点(相比之下,KGW、EWD 和 Unigram 为 7.5-11.5 个奖励点),并且在两个模型中都将自然性和多样性保留在接近无水印的水平。权衡是互补的鲁棒性配置文件:SLAM 可以抵抗字级编辑,但容易受到重组语法(以质量成本)的释义的影响,这与词元分配方法相反。