论文

污染情况下大语言模型生成文本的稳健检测

Robust Detection of LLM-Generated Text under Contamination

AI 基础设施AI安全与内容治理基础设施

摘要

我们研究了编辑和污染下大语言模型生成的文本的检测。将人类和机器文本建模为具有 Huber 污染的有限阶马尔可夫过程,我们在假设下描述了可靠检测的精确边界。当污染物相对于清洁源分离足够大时,检测是不可能的。低于此边界,一系列截断似然比测试可以消除最坏情况的错误。这种结构将剪切作为现有统计检测器的简单修改。对于一大类加性分数,我们确定了剪裁测试保持一致而原始测试的最坏情况功效趋于零的条件。我们在 RAID 基准测试中评估了三个数据集和三代模型中的七个检测器。裁剪提高了两项研究的稳健性,增益因探测器和污染设置而异。例如,在目标误报率为 5% 的情况下,在对照研究中,裁剪将对数似然-对数秩比 (LRR) 检测器的真阳性率提高了 8.3 个百分点,在特定于速率和攻击的 RAID 评估中分别提高了 2.1 和 4.3 个百分点。