论文

线性探测为机器生成的文本提供稳健、高效的检测

Linear Probing Provides Robust and Efficient Detection of Machine-Generated Text

模型评测模型行为与机制分析

摘要

由于潜在的误用,区分机器生成的文本 (MGT) 和人类编写的文本 (HWT) 变得越来越重要。然而,大多数监督检测器通常会降低域外(OOD)性能,并且需要大量、多样化的训练集。在这项工作中,我们分析了 MGT 表示的线性度和质量,并表明简单的线性探针优于各种检测器,同时样品效率显着提高。我们首先证明 MGT 和 HWT 潜在表示在低维空间中是线性可分的,并通过其表示质量的系统差异为这种可分离性提供了合理的解释。受这些见解的启发,我们训练了两种简单线性探针的变体,并针对 16 个基线在 4 个基准测试中对它们进行了评估。探针持续改进 OOD 检测 (+11 AUC),仅需要 ${<}100$ 样本即可达到接近峰值的性能。我们表明,这种可转移性的出现是因为探针恢复了一个共享的潜在 MGT 方向,该方向在不同的设置中通用。最后,我们证明探测向量可以捕获连续的“机器性”谱,突出了它们对人工智能编辑文本进行细粒度估计的潜力。总体而言,我们的工作深入了解了 MGT 和 HWT 之间的潜在空间差异,并展示了线性探针作为稳健且样品高效的 MGT 检测器的潜力。我们在 ~\href{https://github.com/gerritq/mgt_probes}{github} 上发布了我们的代码。