论文

打破生成器障碍:可泛化人工智能文本检测的解缠结表示

Breaking the Generator Barrier: Disentangled Representation for Generalizable AI-Text Detection

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

随着 大语言模型 (LLM) 生成的文本越来越类似于人类书写,区分人工智能生成的内容和人类书写的内容的微妙线索变得越来越难以捕捉。对特定于生成器的工件的依赖本质上是不稳定的,因为新模型迅速出现并降低了此类捷径的稳健性。这将看不见的生成器概括为人工智能文本检测的核心且具有挑战性的问题。为了应对这一挑战,我们提出了一个渐进式结构化框架,将人工智能检测语义与生成器感知的工件分开。这是通过紧凑的潜在编码来实现的,该编码鼓励语义最小化,然后是基于扰动的正则化以减少残留纠缠,最后是使表示与任务目标保持一致的判别性适应阶段。 MAGE 基准测试涵盖 7 个类别的 20 个有代表性的 LLM,证明了与最先进方法相比的一致改进,实现了高达 24.2% 的准确度增益和 26.2% 的 F1 改进。值得注意的是,随着训练生成器多样性的增加,性能不断提高,证实了开放集场景中强大的可扩展性和泛化性。我们的源代码将在 https://github.com/PuXiao06/DRGD 公开提供。