论文

语言模型水印检测的预测似然比

Predictive Likelihood Ratios for Language Model Watermark Detection

模型评测评测方法与指标

摘要

带密钥水印检测检验观测词元与由秘密密钥重建的伪随机变量之间是否存在依赖。基于Li等人(2025)的枢轴框架,本文构建预测似然比,对不确定的概率缺额与剩余尾部分布取平均,目标是在不同备择设定下获得稳健检测能力,而无需选定单一信号强度参数。混合先验结合尾部形状和有效宽度,分层扩展允许缺额或宽度在文档内变化。检验在固定显著性水平下最大化先验平均检验效能,但一般既不是一致最强检验,也不是极小极大检验。在精确条件枢轴零假设下,每次观测前选择并归一化的预测备择形成贝叶斯因子,同时也是检验鞅:第一类错误控制不受备择模型设定错误影响,可在可选停止下保持有效。这一保证不涵盖条件零假设被违反的情况,插值实现也没有经认证的任意时刻有效性保证。Gumbel边际似然通过固定数值求积计算。在所测尾部形状、宽度及三个观测长度下,相对所测最佳规则,联合尾部混合的第二类错误率最大观测遗憾为0.0080,等尾混合为0.0962。在两个公开模型温度匹配的输出上,八个未饱和模型—温度设置的AUC均超过等尾基线,但领先参考评分通常仍有更高AUC。补充实验显示,独立的近似零假设替换下仍保持检验效能;分层依赖建模带来的变化较小。证据支持对所测备择设定的稳健性,而非统一效能保证或抵抗任意文本编辑。