论文
各种人工智能生成的文本检测方法的释义攻击弹性
Paraphrasing Attack Resilience of Various AI-Generated Text Detection Methods
摘要
最近LLM的大规模出现,为处理其后果(例如抄袭或在互联网上传播虚假信息)留下了开放的空间。再加上人工智能检测器绕过工具的兴起,人们对可靠的机器生成文本检测的需求越来越高。我们研究了各种机器生成的文本检测方法的释义攻击弹性,评估了三种方法:微调 RoBERTa、双筒望远镜和文本特征分析,以及使用随机森林分类器的组合。我们发现,包含双筒望远镜的组合产生了最强的结果,但它们在攻击期间也遭受了最严重的损失。在本文中,我们提出了人工智能文本检测领域中性能与弹性的二分法,这使得当前最先进技术的可靠性认知变得复杂。