论文

IdeaLens:检测长篇写作中的人工智能想法

IdeaLens: Detecting AI Ideas in Long-form Writing

模型评测安全与风险评测

摘要

虽然现代人工智能探测器可以识别出这些文字是谁写的,但人工智能中新兴的策略的使用越来越取决于一个不同的问题:谁提出了这些想法?我们推出了 IdeaLens,这是一种检测器,可以识别文档的想法是来自人类还是人工智能(想法来源),而不管文档的文字是谁写的。为了将 IdeaLens 的重点放在想法而不是散文上,我们将文档表示为大纲:每个项目列表将一个话语角色与内容的简短转述描述配对,从而最大限度地减少与原始文本的单词级重叠。我们在带有散文出处检测器 Pangram 的银色标签的 1M FineWeb 文档上训练 IdeaLens。由于轮廓在很大程度上剥夺了表面信息,因此标签必须主要通过想法来适应。在一项对照研究中,随着模型根据越来越详细的人类计划进行编写,IdeaLens 的 AI 标记率从 95% 下降到 7%,而 Pangram 4 的标记率仍然为 92%;从AI衍生计划来看,IdeaLens保持在96%以上。相反,在人类作者根据人工智能生成的计划编写的 50 个故事的新数据集上,IdeaLens 将 68% 的故事标记为人工智能,而 Pangram 4 的这一比例为 8%。在 19 个现有检测基准的综合套件中,我们表明 IdeaLens 在较低的误报率下保持了较高的检测率,这表明想法本身提供了强大的判别信号,并且其性能跨领域、格式和语言保持不变。最后,我们检查了 IdeaLens 的 90K 预测,以描述人类和人工智能构思之间的系统差异。我们发布我们的模型和标记数据集,以促进未来关于想法来源检测的研究。

IdeaLens:检测长篇写作中的人工智能想法的原论文方法或结果图
图 1:IdeaLens 追踪想法;传统的检测器会跟踪措辞。我们提出了四个象限,涵盖共享起源(完全人类或完全人工智能)和混合起源(人类思想和人工智能散文,或人工智能思想和人类散文)场景。与传统检测器(例如 Pangram 4、glickenhaus2026pangram4technicalreport;EditLens-3B、thai2026editlens)不同,IdeaLens 可以准确检测想法的来源,而不是散文的来源。 IdeaLens 将 94.7% 的基于人类想法的人工智能生成文档归类为人类,而 Pangram 仅将 43.8% 标记为人类。在我们遵循 AI 想法的人类撰写故事的新数据集中 (§3),IdeaLens 将 68.0% 标记为 AI,而 Pangram 和 EditLens 分别仅标记 8.0% 和 0.0%。