ARB:用于人工智能文本检测器评估的匹配作者重写基准数据集
ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation
摘要
标准 AI 文本检测基准将人类编写的文本与 大语言模型 (LLM) 直接生成的文本进行比较。虽然之前的工作表明重写和释义会降低检测器的性能,但目前尚不清楚当人类创作的内容被 LLM 重写时,在此传统基准上测量的性能是否可以预测检测器的行为。为了解决这一差距,我们引入了作者重写基准 (ARB),它由 1,800 个人类源文本(XSum、WritingPrompts 和 OpenWebText 各 600 个)和四个开放权重生成器(Llama-3.2-3B、Qwen2.5-7B、Mistral-7B、Gemma-2-9B)构建。每个源项目都会生成四个匹配的变体:人工编写的 (HUMAN)、直接 LLM 生成 (Free-LLM)、LLM 重写的人类文本 (H2L) 和相同生成器 LLM 重写的 LLM 文本 (LLM2L)。我们在严格的 1% 误报操作点 (TPR@1%FPR) 下评估了五种探测器(FastDetectGPT、Binoscopy-falcon-7b、RADAR、BERT-Defense、RoBERTa-Defense)。 FastDetectGPT 和 Binoscopy-falcon-7b 检测到了 91.2% 和 93.5\% 的直接 LLM 文本,但只有 30.8% 和 15.1% 的人类文本被 LLM 重写,下降了 60-78 个百分点。当 LLM 文本被同一模型重写时,相同的检测器保留了 78.3% 和 83.0% 的召回率,下降幅度要小得多,为 10-13 个百分点。 RADAR 遵循相同的模式(66.8% 到 12.2%),而 BERT-Defense 和 RoBERTa-Defense 在所有体系中的召回率都保持在 3% 以下。这些结果表明,在传统的人类与 LLM 基准测试上测量的检测器性能不会转移到由 LLM 修改的人类创作文本,即使相同的检测器对于仅 LLM 重写仍然具有很大的鲁棒性。