论文
反图灵测试的结果:人工智能生成的文本检测
Findings of the Counter Turing Test: AI-Generated Text Detection
摘要
大语言模型 生成流畅、上下文连贯的文本的能力不断增强,这给负责确保数字内容真实性的系统和机构带来了越来越大的压力。 GPT-4、Claude 3.5 和 Llama 等先进的生成模型可以生成高度连贯且类似人类的文本,使得区分人类编写的内容和人工智能生成的内容变得越来越困难。虽然这些模型具有变革性的应用,但它们的滥用引起了人们对错误信息、偏见叙述和安全威胁的担忧。本文对最先进的人工智能生成文本检测技术进行了全面分析,并通过反图灵测试(CT2)共享任务评估其有效性。任务 A(二元分类)要求参与者区分人类编写的文本和人工智能生成的文本,而任务 B(模型归因)则侧重于识别负责生成给定文本的特定语言模型。结果展示了二元分类的高性能,顶级系统的 F1 分数为 1.0000,但模型归因的分数明显较低,其中最好的系统达到了 0.9531,凸显了该任务的复杂性增加。表现最好的团队利用了微调的 Transformer 模型、集成学习和混合检测方法,基于 DeBERTa 和基于 BART 的方法展示了强大的结果。然而,任务 B 中的较低分数凸显了区分不同 LLM 输出的挑战,需要进一步研究对抗鲁棒性、特征提取和跨域泛化。