论文
为什么人工智能检测无法保证学术诚信
Why AI Detection Fails for Academic Integrity
摘要
机构使用商业人工智能检测器来保证学术诚信,但检测器无法区分人工智能编辑和完整的 LLM 草稿,并可能将两者视为不当行为。在对已发表的英文摘要(四个领域;2013 年至 2015 年与 2023 年至 2025 年)进行的对照研究中,我们在 tau=0.50 的代理人类/人工智能标签下量化了这一政策失败。轻度“仅精炼摘要”编辑(符合指南的人工智能辅助的代理)被标记为 38% 至 80%。未经修改的 2023 年至 2025 年原件被标记为 9% 至 15%,非 STEM 比率远高于 STEM(p<0.001);高分跟踪的是长标记和学术词汇列表的密度,而不仅仅是作者的意图。在“无法检测到的 AI 人性化”之后,规避几乎是全部:只有不到 4% 的 AI 标记重写仍然被标记(人性化后检测率 <4%;FNR >96%)。诚实的人工智能编辑比人性化辅助规避的制裁风险更高。因此,检测器分数不应作为独立的不当行为证据。