论文
TripPattern:一种基于模式的文本水印方法用于大语言模型
TripPattern: A Pattern-based Text Watermarking Method for Large Language Models
摘要
文本水印技术因能识别机器生成文本并降低大语言模型(LLMs)风险而受到广泛关注。现有方法通常将LLM词汇表划分为绿色和红色词元,但鼓励生成向绿色词元可能降低文本质量与自然性。为解决此问题,我们提出TripPattern,一种将文本水印问题建模为基于模式匹配任务的框架,使用三个词汇分区。TripPattern将词汇表划分为一个中性组和两个模式组。在生成过程中,模型在两个模式组间交替选择词元以嵌入可检测的模式,而中性词元独立选择以提升灵活性并保持自然性。检测阶段,TripPattern采用基于模式的统计检验,通过测量相邻词元在模式组间交替的频率来提供可解释的p值。理论分析和在四个多语言数据集上的实证评估表明,TripPattern在保持LLM生成质量的同时实现了强健的水印可检测性。