论文

DetectRL-X:实现可靠的多语言和真实世界的 LLM 生成的文本检测

DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection

模型评测基准与评测资源

摘要

由于滥用风险不断增加,对 大语言模型 (LLM) 生成内容的有效检测和治理变得越来越重要。尽管现有检测器的性能令人印象深刻,但它们在多语言、现实场景中的可靠性和潜力在很大程度上仍未得到充分开发。在本研究中,我们引入了 DetectRL-X,这是一个综合性多语言基准测试,旨在评估 8 个维度的高级检测器。该基准测试涵盖商业环境中常用的 8 种语言,并从 6 个极易受到 LLM 滥用的领域收集人类编写的文本。为了更好地与现实世界的应用程序保持一致,我们使用 4 个流行的商业 LLM 创建 LLM 生成的文本,并包括典型的人工智能辅助书写操作,例如抛光、扩展和压缩,以捕获真实的使用模式。此外,我们开发了一个用于释义和扰动攻击的多语言框架,以模拟不同的人类修改和书写噪声,从而能够对跨语言的检测器进行压力测试。 DetectRL-X 的实验结果揭示了当前最先进的检测器在应用于不同语言资源时的优点和局限性。我们进一步分析域、生成器、攻击策略、文本长度和细化操作如何影响不同语言的性能,强调 DetectRL-X 作为加强多语言和特定语言检测器的有效基准。