论文

蒸馏思维,为答案加水印:面向大推理模型的主语义引导水印

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

模型推理解码与生成控制

摘要

擅长复杂任务的推理型大语言模型(RLLM)给数字水印带来了独特挑战:现有方法常常破坏逻辑连贯性或带来高昂计算成本。基于 token 的水印技术会通过施加伪随机偏置破坏推理流,语义感知方法虽能改善质量,但引入显著延迟或需要辅助模型。本文提出 ReasonMark,一个专为重推理 LLM 设计的新型水印框架。我们的方法将生成解耦为不受干扰的思考阶段(Thinking Phase)和加水印的回答阶段(Answering Phase)。我们提出关键性评分(Criticality Score)从推理轨迹中识别语义上关键的 token,并将其蒸馏为主语义向量(PSV)。PSV 随后引导一个语义自适应机制,根据 token 与 PSV 的对齐程度调节水印强度,在不损害逻辑完整性的前提下确保鲁棒性。大量实验表明,ReasonMark 超越最先进方法:文本困惑度降低 0.35,翻译 BLEU 提高 0.164,数学准确率提高 0.67 分;这些进步同时伴随高出 0.34% 的水印检测 AUC 和对攻击更强的鲁棒性,且延迟增加可忽略不计。这项工作使推理 LLM 能够在真实应用中可追溯、可信地部署。

蒸馏思维,为答案加水印:面向大型推理模型的主语义引导水印 配图
图 1:ReasonMark 在思考阶段(II.)识别 top-K 关键 token,并使用 PCA(III.)建立初始主语义向量(Principal Semantic Vector, PSV)。随后,该语义向量通过动态调整 logits——偏向语义连贯的绿色 token、惩罚具有破坏性的 token——来引导水印过程(IV.)。这使得只需一次采样即可高效生成语义连贯、绿色 token 占比很高的水印序列(V.)。