论文
TSM-Bench:在现实世界的维基百科编辑实践中检测 LLM 生成的文本
TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices
摘要
自动检测机器生成文本 (MGT) 对于维护用户生成内容 (UGC) 平台(例如维基百科)的知识完整性至关重要。现有的检测基准主要关注 \textit{generic} 文本生成任务(例如,“写一篇关于机器学习的文章。”)。然而,编辑经常使用 LLM 来完成特定的写作任务(例如摘要)。这些 \textit{特定于任务的} MGT 实例由于其受约束的任务表述和上下文条件,往往更类似于人类编写的文本。在这项工作中,我们展示了一系列 SOTA MGT 检测器难以识别反映维基百科上真实世界编辑的特定任务 MGT。我们引入了 \textsc{TSM-Bench},一个多语言、多生成器和 \textit{multi-task} 基准,用于评估 MGT 检测器在常见的、现实世界的维基百科编辑任务上的性能。我们的研究结果表明,与之前的基准相比,(\textit{i}) 平均检测精度下降了 10--40\%,并且 (\textit{ii}) 存在泛化不对称性:特定任务数据上的 微调 可以泛化到通用数据(甚至跨域),但反之则不然。我们证明,专门在通用 MGT 上进行微调的模型会过度拟合机器生成的表面产物。我们的结果表明,与之前的基准相比,大多数检测器对于 UGC 平台等现实环境中的自动检测仍然不可靠。因此,\textsc{TSM-Bench} 为开发和评估未来模型提供了重要的基础。