论文
从经验调参到检验功效校准:LLM水印的统计框架
Beyond Heuristic Tuning: Power-Calibrated LLM Watermarking
摘要
基于 logits 的水印是一种广泛使用的机制,用于识别 LLM 生成的内容,但其有效性取决于可检测性和语义失真之间的基本权衡。现有的分析为有原则的超参数选择提供了有限的指导,使得实际部署依赖于启发式调整。在这项工作中,我们开发了一个检验功效校准的统计框架,该框架在水印超参数、检测检验功效和失真之间建立了明确的定量关系。这种表征将水印设计转变为引导优化问题。基于这些结果,我们推导出实用的参数选择程序,在约束下实现最佳权衡。跨多种语言模型和数据集的大量实验验证了该理论,并证明所提出的框架一致地识别了帕累托最优点。