论文

击败风格检测器:人工智能文本军备竞赛的三个小时代理研究

Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

应用与实践科学研究

摘要

重现一项实证 NLP 研究过去需要花费数周的时间。鉴于已发布的数据和现代代理研究工具,我们重做了最近 ACL\,2026 一项关于 LLM 草稿的个人风格后期编辑研究的每一项实验,并添加了三个新实验,其中人类调查员仅充当循环中的审阅者。我们重现了所有七个预先注册的假设,并将感知自相似性和嵌入测量的自相似性之间的论文标题相关性恢复到小数点后三位($r{=}{+}0.244$、$p{<}10^{-8}$、$n{=}648$)。在无泄漏保留协议下,GPT-5.5 和 Claude\,Opus\,4.7 在 $324$ 配对任务上缩小了 $71$--$75\,% 与同一作者上限的风格差距,而人工译后编辑则为 $24\,%,并且在 $\sim$$80\,% 任务上击败了人类译后编辑。然后,我们将相同的数据构建为人工智能文本检测军备竞赛。 LUAR-MUD 嵌入上的 leftauthors-out 线性 SVM 在各种方法中达到 AUC $0.93$--$1.00$;六项诊断表明,GPT-5.5 检测主要是长度混淆,而 Opus 检测是真正的风格签名。给定针对冻结检测器的 $T{=}20$ 反馈迭代,Opus 代理会将五个保留的测试模拟中的两个翻转到人类半空间,并将每个边缘缩小一个数量级。通过对已知检测器的适度努力,前沿 LLM 已经可以有效地降低其自身的 AI 检测概率。所有代码、648份模仿草稿、经过训练的检测器、诊断和对抗轨迹均已发布。