论文
对数似然、辛普森悖论和机器生成文本的检测
Log-Likelihood, Simpson's Paradox, and the Detection of Machine-Generated Text
摘要
可靠区分人类书写文本和 大语言模型 生成文本的能力具有深远的社会重要性。解决这个问题的主要方法利用了似然假设:对于检测器语言模型来说,机器生成的文本应该比人类编写的文本更有可能出现。然而,我们证明了区分人类和机器文本的 词元级 信号在检测器模型的隐藏空间中是不均匀的,并且像大多数检测器一样,在具有根本不同的统计结构的区域之间天真地平均基于似然的标记分数,会导致辛普森悖论的一种形式:强大的局部信号被不适当的聚合破坏。为了纠正这个问题,我们引入了基于贝叶斯决策理论的学习局部校准步骤。我们不是聚合原始标记分数,而是首先学习以隐藏空间中的位置为条件的分数分布的轻量级预测器,然后聚合校准的对数似然比。这种单一干预显着且持续地提高了我们考虑的所有基线检测器和所有数据集的检测性能。例如,我们的 Fast-DetectGPT 校准变体在 GPT-5.4 文本上将 AUROC 从 0.63提高到 0.85,而我们引入的本地校准 DMAP 检测器全面实现了最先进的性能。也就是说,我们的核心贡献不是新的检测器,而是对现有检测器性能不佳的重要原因的精确诊断,以及与任何词元平均管道兼容的有原则的模块化补救措施。这将作为社区发展的基础,提供自然途径,包括更丰富的分布模型、改进的校准策略以及通过完整贝叶斯最优决策规则与隐藏空间几何信号进行原则性集成。