论文

超越困惑:字符分布签名和 AI 文本检测的 MDTA 基准

Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection

模型评测评测方法与指标

摘要

无需训练 AI文本检测方法主要依赖于模型对数概率,通过双筒望远镜和DNA-DetectLLM等方法实现强大的性能。然而,这些方法面临着一个基本的上限,因为模型是通过 RLHF 进行优化以产生类似人类的概率分布。我们引入了一种基于字符分布签名的替代检测信号。我们提供的理论基础表明,在大规模领域平衡语料库上训练的人工智能模型可以近似全局字符模式,而人类则表现出领域专业化的分布,从而创建了一个“分离之墙”,其中人类与人工智能的差异显着超过了人工智能与人工智能的差异。为了实现系统评估,我们构建了模型-域-温度-对抗(MDTA)基准,其中包含 4 个模型、5 个域、3 个温度设置和 3 个对抗策略的 642,274 个提示对齐样本,通过现代模型响应、温度变化和对抗增强大幅扩展了 HC3 数据集。我们引入了字母分布分数(LD-Score),证明与困惑方法的低相关性(r = 0.08-0.13)。当通过非线性分类器与 DNA-DetectLLM、Binoscopy 和 FastDetectGPT 集成时,LD-Score 在 AUROC 和 F1 方面产生了一致的改进,在词汇限制放大检测信号的专业领域中的增益尤其明显。 MDTA 数据集可通过以下网址访问:https://huggingface.co/datasets/nsp909/MDTA。