论文
焦点和盲点:评估机器生成的文本检测
Spotlights and Blindspots: Evaluating Machine-Generated Text Detection
摘要
随着生成语言模型的兴起,机器生成的文本检测已成为一项严峻的挑战。可用的模型多种多样,但不一致的数据集、评估指标和评估策略模糊了模型有效性的比较。为了解决这个问题,我们评估了来自 6 个不同系统的 15 种不同的检测模型,以及 7 个经过训练的模型,涵盖 7 个英语文本测试集和 3 个创造性的人类编写的数据集。我们对模型性能、训练和评估数据的影响以及关键指标的影响进行实证分析。我们发现,没有一个系统在所有领域都表现出色,而且几乎所有系统都对某些任务有效,并且模型性能的表示与数据集和指标选择密切相关。我们发现基于数据集和指标的模型排名存在很大差异,并且在高风险领域的新颖的人类编写文本上总体表现不佳。在数据集和指标中,我们发现经常假设或忽视的方法选择对于清晰准确地反映模型性能至关重要。