论文
2026 ELOQUENT 实验室的 DArgk 团队用于评估生成语言模型质量:人性残留:通过 GRPO 微调进行 AI 检测规避
Team DArgk at the 2026 ELOQUENT lab for evaluating generative language model quality: Residuals of Humanity: AI Detection Evasion via GRPO Fine-Tuning
摘要
大型语言模型 (LLM) 可以生成流畅、连贯的文本,这些文本越来越难以与人类书写区分开来,这推动了自动人工智能生成文本检测器的开发。然而,此类检测器在对抗性生成下的鲁棒性仍然不确定。本文提出了 SHADE(通过对抗性检测器规避进行随机类人生成),这是一种强化学习框架,它将检测器规避制定为策略优化问题。 SHADE 没有应用事后扰动或基于提示的重写,而是使用基于 PAN 2025 mdok 系统的代理检测器的反馈,通过组相对策略优化 (GRPO) 微调指令调整的 LLaMA 模型。我们的实验表明,与基本模型的 1.5\%$ 美元相比,使用较小的 KL 正则化惩罚进行完全微调可以实现 $98.5\%$ 的代理规避,而基于 LoRA 的自适应在正则化下的效果要低得多。语言分析表明,成功的规避与更短、更简单和词汇多样性较低的输出相关,这表明高检测器规避不一定对应于更类似于人类的写作。在官方 Voight-Kampff 竞赛设置中,我们提交的内容排名第六和第七,这表明针对单个代理检测器的优化仅部分转移到看不见的评估分类器。这些结果凸显了强化学习在对抗性人工智能文本生成方面的潜力和局限性,并激发了针对人工智能生成文本检测的更强大的多检测器评估协议。