论文
语言模型的大量更新破坏了人工智能辅助科学写作的筛选
Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
摘要
期刊和会议已开始筛选提交的手稿中使用大语言模型(LLM)编写的文本。这种筛选的可靠性取决于针对一组固定的LLM版本的基准评估,而实际使用的版本不断变化。在这里,我们量化了LLM的流动如何影响科学手稿的筛选。我们将来自《美国国家科学院院刊》的 4,000 份 ChatGPT 前摘要与来自三个供应商的 23 个 LLM 版本的重写(在 2023 年 6 月至 2026 年 8 月期间发布)进行了配对。然后,我们在维护场景下对检测器进行了训练,范围从在每个新版本上重新训练的检测器到训练一次且从未更新的检测器。仅根据供应商过去的版本进行训练的检测器可能会在模型代之间的边界处崩溃:经过校准以错误地标记 1% 的人类编写的摘要,它们捕获了最清晰边界之前 99% 的重写以及紧接其之后的 3.8% 的重写。在较新版本上训练的检测器也可能会错过较早版本的重写。版本之间的词汇差异很大程度上追踪了哪里 检测转移以及失败的地方。在我们模拟的两个筛选场景中,覆盖所有 23 个版本的筛选要么标记了八分之一的人工撰写摘要,要么错过了最新版本的三分之一重写。事实上,商业检测器错过了最清晰边界之后版本的大部分重写,同时几乎没有标记任何人工编写的摘要。因此,研究诚信政策应将检测器的基准准确性视为临时的,并在每个LLM版本(包括早期版本)中重新验证。