论文

机器生成文本中鲁棒水印检测的稳定性感知特征设计

Stability-Aware Feature Design for Robust Watermark Detection in Machine-Generated Text

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型 (LLM) 的广泛采用加剧了对区分人类文本和机器生成文本的原则性方法的需求。水印提供了一种有前途的途径,但现有的检测器在多重释义下以及应用于较短的文本时表现出急剧的性能恶化。我们引入了模式稳定性评分(PSS),这是一种新颖的检测框架,它利用本地统计特征和跨释义变体的稳定性动态。具体来说,所提出的方法将全局和局部 z 得分特征与游程模式的高阶统计相结合,并通过自相关信号和在释义深度上计算的稳定性得分进行丰富。使用多个 LLM(Llama-3-8B、Qwen2-7B)和释义器(Mistral-7B、Qwen2-7B、Gemma-7B)对三个基准数据集(PG-19、CNN/DailyMail 和 WikiText)进行数值评估,在最多八轮释义下系统地压力测试稳健性。与之前的 z 分数阈值基线和一些最先进的深度学习方法相比,我们的方法将不同词元长度的检测 AUC(接收者操作特征曲线下的面积)提高了 10-15 个百分点以上。此外,广泛的跨域实验表明,单个通用分类器无需重新训练即可泛化到不同的 LLM、释义器和文本域,即使所有组件与训练不同,也能保持 87.8% 以上的 AUC。