论文

DeBERTa-Sentinel:实现 AI 生成文本的透明且值得信赖的检测

DeBERTa-Sentinel: Toward Transparent and Trustworthy Detection of AI-Generated Text

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型 (LLM) 在网络上的快速传播引起了人们对错误信息、学术诚信、自动内容操纵以及脆弱在线社区风险的担忧。现有的基于 Transformer 的检测器(例如 GPT-Sentinel)显示出前景,但难以推广到不同的模型输出和释义攻击,从而限制了它们在构建值得信赖的 Web 生态系统中的作用。这项工作介绍了 DeBERTa-Sentinel,这是一个负责任的 AI 生成文本检测框架,利用 DeBERTa-v3 的分散注意力来捕获合成内容中细微的结构不规则性。核心设计原则是透明度:与黑盒商业探测器不同,DeBERTa-Sentinel 公开其决策的 词元级 解释,使受影响的利益相关者记者、教育工作者以及平台信任和安全团队能够审核、质疑和背景化检测结果。使用 28,057 个人类和 LLM 生成的样本(GPT、LLaMA 和 Claude)组成的 GLC-AIText 数据集(GPT、LLaMA 和 Claude),以 60-20-20 分割,DeBERTa-Sentinel 实现了 98.21\% 的验证准确度,并超越了 NeurIPS 2025 的 RoBERTa-Sentinel 基线,实现了 97.53\% 的测试准确度,准确率 95.89%,召回率 99.33%,ROC-AUC 99.53%,假阴性率保持在 0.665%。该模型的可解释性揭示了语言标记,例如与合成文本相关的学术措辞和正式转换,直接支持利益相关者对可验证、可审计的内容真实性决策的需求。通过推进减少偏见和增强可解释性的负责任的检测方法,DeBERTa-Sentinel 促进了值得信赖、道德和以人为本的人工智能系统。代码和数据可在 https://github.com/Galileo-Galili/HUMAN-VS-AI-TEXT-DETECTION 获取。