论文
放大而不是学习:人工智能文本检测中分布外泛化的代价
Amplifying, Not Learning: The Price of Out-of-Distribution Generalization in AI-Text Detection
摘要
人工智能文本检测器控制着教育、招聘和出版方面的决策,但它们将最流畅、最正式的人类写作标记为机器生成的:它们将正式的母语人类文章的中位数评为 99.5% 可能是人工智能,而清除真正的高温人工智能的可能性为 10.5%。部署的检测器共享它(chatgpt- detector-roberta 以 1% 的误报率标记 56% 的正式文章)。这不是一个校准错误,而是一种机制的特征:经过微调的检测器不会学习人工智能与人类的边界,它放大了预先存在的 微调 的继承典型性轴(语言模型下的可预测性),重新调整它而不是构建它。将检测器分解为这个继承的读数和微调的残差,继承的部分承载了大量的跨生成器转移并产生正式人类的过度标记,而残差是生成器特定的并且不转移;每类约 25 个标签上的冻结表示探针与看不见的生成器上完全微调的检测器相匹配(跨生成器 AUROC 0.893 与 0.831)。这产生了一个不行:因为传输的轴是过度标记的轴,我们测试的没有训练目标、阈值、概念擦除或集成消除了危害,同时保留跨生成器检测、跨三种架构、微调解码器和零样本困惑检测器。封闭形式的 无需训练 操作员重新定位并诊断偏差(恢复已失效部署的探测器,在 1% 的误报率下,真阳性率为 0 到 0.904),但与禁止操作一致,在跨生成器检测上是 AUROC 中性:它移动了偏差,但无法消除偏差。该机制并非英语散文所特有的:过度标记和分解在中文和代码中都有重复。检测器不公平性是检测范式的可预测的结构属性,是分布外泛化的代价。