论文
Show, Don't TELL:可解释的AI生成文本检测
Show, Don't TELL: Explainable AI-Generated Text Detection
摘要
AI生成文本检测研究已提出多种区分人类与AI文本的方法,其中一些取得了很高的分布内性能。然而,现实适用性陷入停滞,因为其输出与用户需求错位:例如教授们只看到一个没有附带解释的数字分数。我们用新架构TELL解决这一问题,它从底层就把可解释性内建其中。为保持可比性,我们的系统仍像其他检测器一样提供数值分数,但TELL采取根本不同的思路:向用户展示模型判定文本为AI或人类写作所依据的“破绽”,让用户结合自己对写作情境和声称作者的理解,自行判断文本出自谁手。我们在一个由领域特定作者归属标注组成的定制SFT数据集上训练TELL,并进一步使用带课程学习的GRPO精调系统以提升性能。我们取得了与最先进检测器相当的性能(AUROC 0.927),同时原生提供解释检测器判定依据的标注。我们进一步用一个人工标注数据集评估解释质量,并报告了在标注的具体性、可证伪性、连贯性、合理性与依据性上的高胜率(平均72.3%),使用户能够批判性思考并自行决策。因此,我们的工作以以人为本的视角重新框定AI生成文本检测问题,为聚焦原生可解释性的新一类检测器铺平道路。
