论文
文风作为混淆变量:AI检测非母语学术写作的假阳性
Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing
摘要
AI文本检测器越来越多地被用于学术场景,但其输出反映的是AI创作本身,还是与润色后的学术英语相关的更广泛语言特征,仍不清楚。以往研究报告了非母语英语写作的高假阳性率(FPR),但群体层面的比较将作者身份与主题、领域和写作风格的差异混在了一起。专业编辑为考察这一问题提供了有用的场景,因为它在保持作者身份和内容不变的情况下改变稿件的语言形式。我们检验了一家专业英语编辑服务(2018-2025年)的135,389对文档,包括非母语稿件及其经母语者编辑的版本,以在控制内容和作者身份的情况下评估编辑如何影响检测器响应。在13个AI文本检测器中,人类撰写文本的假阳性率差异巨大,从0.0%到100.0%不等。不同检测器的响应各异:同样的编辑在某些检测器中提高了AI分数,在另一些检测器中则降低了分数。值得注意的是,分数变化与编辑幅度相关。研究结果将专业编辑文风确定为AI检测器输出中的关键混淆变量,而非实现文本来源与语言风格的完全分离,这引发了关于学术场景公平性与可靠性的担忧。