论文
IdeaLens:检测长篇写作中的人工智能想法
IdeaLens: Detecting AI Ideas in Long-form Writing
摘要
虽然现代人工智能探测器可以识别出这些文字是谁写的,但人工智能中新兴的策略的使用越来越取决于一个不同的问题:谁提出了这些想法?我们推出了 IdeaLens,这是一种检测器,可以识别文档的想法是来自人类还是人工智能(想法来源),而不管文档的文字是谁写的。为了将 IdeaLens 的重点放在想法而不是散文上,我们将文档表示为大纲:每个项目列表将一个话语角色与内容的简短转述描述配对,从而最大限度地减少与原始文本的单词级重叠。我们在带有散文出处检测器 Pangram 的银色标签的 1M FineWeb 文档上训练 IdeaLens。由于轮廓在很大程度上剥夺了表面信息,因此标签必须主要通过想法来适应。在一项对照研究中,随着模型根据越来越详细的人类计划进行编写,IdeaLens 的 AI 标记率从 95% 下降到 7%,而 Pangram 4 的标记率仍然为 92%;从AI衍生计划来看,IdeaLens保持在96%以上。相反,在人类作者根据人工智能生成的计划编写的 50 个故事的新数据集上,IdeaLens 将 68% 的故事标记为人工智能,而 Pangram 4 的这一比例为 8%。在 19 个现有检测基准的综合套件中,我们表明 IdeaLens 在较低的误报率下保持了较高的检测率,这表明想法本身提供了强大的判别信号,并且其性能跨领域、格式和语言保持不变。最后,我们检查了 IdeaLens 的 90K 预测,以描述人类和人工智能构思之间的系统差异。我们发布我们的模型和标记数据集,以促进未来关于想法来源检测的研究。
