论文
论通过水印保护Agentic系统的知识产权
On Protecting Agentic Systems' Intellectual Property via Watermarking
摘要
大语言模型(LLM)演化为执行自主推理与工具使用的agentic系统,创造了显著的知识产权(IP)价值。我们证明这些系统极易受到模仿攻击:攻击者通过在受害方输出上训练模仿模型来窃取专有能力。关键在于,现有LLM水印技术在这一领域会失效,因为现实中的agentic系统常以灰盒形式运行,隐藏了验证所需的内部推理轨迹。本文提出AGENTWM,首个专为agentic模型设计的水印框架。AGENTWM利用动作序列的语义等价性,通过细微偏置功能相同的工具执行路径的分布来注入水印。这一机制使AGENTWM能把可验证信号直接嵌入可见的动作轨迹,同时对用户保持不可分辨。我们开发了自动生成鲁棒水印方案的流水线,以及一套严格的统计假设检验验证程序。在三个复杂领域上的广泛评估表明,AGENTWM在几乎不影响智能体性能的情况下实现了高检测准确率。我们的结果证实,AGENTWM能有效保护agentic知识产权免受自适应攻击者攻击,这些攻击者无法在不严重降低被盗模型效用的情况下去除水印。
