论文
蒸馏思维,为答案加水印:面向大推理模型的主语义引导水印
Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models
摘要
擅长复杂任务的推理型大语言模型(RLLM)给数字水印带来了独特挑战:现有方法常常破坏逻辑连贯性或带来高昂计算成本。基于 token 的水印技术会通过施加伪随机偏置破坏推理流,语义感知方法虽能改善质量,但引入显著延迟或需要辅助模型。本文提出 ReasonMark,一个专为重推理 LLM 设计的新型水印框架。我们的方法将生成解耦为不受干扰的思考阶段(Thinking Phase)和加水印的回答阶段(Answering Phase)。我们提出关键性评分(Criticality Score)从推理轨迹中识别语义上关键的 token,并将其蒸馏为主语义向量(PSV)。PSV 随后引导一个语义自适应机制,根据 token 与 PSV 的对齐程度调节水印强度,在不损害逻辑完整性的前提下确保鲁棒性。大量实验表明,ReasonMark 超越最先进方法:文本困惑度降低 0.35,翻译 BLEU 提高 0.164,数学准确率提高 0.67 分;这些进步同时伴随高出 0.34% 的水印检测 AUC 和对攻击更强的鲁棒性,且延迟增加可忽略不计。这项工作使推理 LLM 能够在真实应用中可追溯、可信地部署。
