论文
SemTrace:用于跟踪 LLM 对受保护文档的暴露的基于源的语义签名
SemTrace: Source-Grounded Semantic Signatures for Tracing LLM Exposure to Protected Documents
摘要
大语言模型 越来越多地用于读取文档并生成下游文本,当文档所有者无法控制或检查执行生成的模型时,就会产生来源问题。我们引入了 SemTrace,一种基于源的语义水印,用于检测生成的评论是否受到已知受保护手稿副本的影响。 SemTrace 不是偏向标记概率或强加表面形式模式,而是根据手稿本身直接支持的事实命题构建特定于文档的二进制签名。受保护的 PDF 无形地带有内容契约,该契约从每个二进制对中选择一个事实,并要求遵循指令的审阅者在固定的审阅时段中表达这些事实,而不改变其独立评估。然后,冻结的自然语言推理模型通过显式擦除对生成的语义证据进行解码,并根据分配给该副本的码字对恢复的位进行评分。此设计的目标是与模型无关的分配副本曝光检测,同时保持水印在语义上与源文档相关联。