论文

Show, Don't TELL:可解释的AI生成文本检测

Show, Don't TELL: Explainable AI-Generated Text Detection

模型训练监督微调与指令调优强化学习RLVR

摘要

AI生成文本检测研究已提出多种区分人类与AI文本的方法,其中一些取得了很高的分布内性能。然而,现实适用性陷入停滞,因为其输出与用户需求错位:例如教授们只看到一个没有附带解释的数字分数。我们用新架构TELL解决这一问题,它从底层就把可解释性内建其中。为保持可比性,我们的系统仍像其他检测器一样提供数值分数,但TELL采取根本不同的思路:向用户展示模型判定文本为AI或人类写作所依据的“破绽”,让用户结合自己对写作情境和声称作者的理解,自行判断文本出自谁手。我们在一个由领域特定作者归属标注组成的定制SFT数据集上训练TELL,并进一步使用带课程学习的GRPO精调系统以提升性能。我们取得了与最先进检测器相当的性能(AUROC 0.927),同时原生提供解释检测器判定依据的标注。我们进一步用一个人工标注数据集评估解释质量,并报告了在标注的具体性、可证伪性、连贯性、合理性与依据性上的高胜率(平均72.3%),使用户能够批判性思考并自行决策。因此,我们的工作以以人为本的视角重新框定AI生成文本检测问题,为聚焦原生可解释性的新一类检测器铺平道路。

Show, Don't TELL:可解释的AI生成文本检测:论文配图
((a)) ZeroGPT((b)) Pangram((c)) QuillBot((d)) Grammarly((e)) TELL图 1:现有 AI 生成的文本检测器(例如 1(a)-1(d))仅向用户提供二进制尺度的预测。相比之下,TELL (1(e)) 为每个决策提供了可读的解释,因此用户可以理解它们并做出自己的决定。→\rightarrow 例如,上面的示例(来自 Wang 等人(2024),由 BLOOMZ 编写)乍一看可能会被认为是人类编写的。但它说“NFS […] 使用两台服务器 […],其中一台既充当服务器,另一台充当客户端”——这是一个明显的矛盾(也是人工智能生成的信号)。 TELL是唯一能够指出这种具体证据并让用户自行判断的探测器。