论文
Agent调用基础语言模型拼接文本,可绕过AI内容检测
Agents Can Use Base Models to Evade AI Detection
摘要
我们证明,配备基础语言模型的编码Agent可以成功地从其样本中组装响应以逃避检测。基础模型已被证明可以逃避商业检测器,然而,先前的“人性化”技术依赖于使用这些模型对AI输出进行多轮改写,这总是会导致语义漂移。相比之下,让编码Agent通过从基本模型中拼接文本样本来直接编排写作过程,可以产生连贯的、特定于任务的且总体高质量的输出。我们发现,在 Claude Code Harness中运行的 Claude Opus 5 可以有效地编排本地 32B 参数 OLMo-2 基础 LM,并且在跨创意写作、事实基础、健康 QA 和指令遵循的基准测试中牺牲很少的任务准确性,同时使用高达 90% 的基础 LM 词元。以这种方式构建的响应降低了事后检测器的有效性(Pangram v4 检测率从 77% 下降到 24%)和先验应用于Agent生成结果的软水印(低至低 FPR 下的模拟 10% 检测)。虽然有效,但这种规避需要Agent提供大量的输入和输出词元,从而使每次查询的美元成本按 API 定价增加高达 30 倍。总体而言,这项工作展示了针对人工智能文本检测的新型对抗性攻击的有效性,并敦促事后检测提供商将基础模型的输出纳入其训练中。