论文

通过自蒸馏学习遵循上下文水印指令

Learning to Follow In-Context Watermark Instructions via Self-Distillation

模型训练监督微调与指令调优

摘要

上下文水印 (ICW) 在查询前添加一条指令,要求模型在其响应中嵌入统计上可检测的信号。因此,它为LLM配备了水印接口,第三方可以调用该接口而无需访问模型内​​部。其可靠性取决于LLM是否遵循指令而不降低答案质量,但目前的LLM在这方面的表现如何尚未得到衡量。我们引入 $\mathsf{ICWBench}$,这是三个可验证的 ICW 指令系列的基准,每个指令系列都在可检测性和答案质量上进行了评分。通过评估 14 个前沿专有和开源LLM,我们发现所评估的LLM没有一个能够实现所有三个系列的这两个目标。为了解决这个问题,我们提出了一种独立的两阶段训练方法,不需要从更强的模型中进行蒸馏,不需要手动注释,也不需要预先存在的 ICW IF 能力。第一阶段,带有logits扰动的自蒸馏(SDLP),使用与教师和学生相同的基础LLM:指令等效的解码时间logits扰动使教师遵循ICW指令,并且训练学生以匹配教师的输出分布。第二阶段应用强化学习,并以自动验证器作为奖励。应用于 Qwen3-14B 和 GPT-OSS-20B,我们的方法将三个 ICW 指令的平均 TPR@$1\%$FPR 分别从 $0.100$ 提高到 $0.974$ 和从 $0.337$ 提高到 $0.968$,同时在困惑度评估和 LLM-as-a-Judge 下保持高响应质量。