论文

DeBERTa-ConPara:AI 生成文本的攻击感知和部署现实检测

DeBERTa-ConPara: Attack-Aware and Deployment-Realistic Detection of AI-Generated Text

模型训练监督微调与指令调优

摘要

在部署条件下对人工智能生成的文本进行鲁棒检测具有挑战性:跨域和生成器的分布变化、输入表面的对抗性扰动以及缺乏用于阈值校准的目标域标签都会降低在域内表现良好的检测器的性能。我们推出了 DeBERTa-ConPara,这是一种面向部署的检测器,将攻击感知的 Unicode 预处理与经过 HC3 Plus、M4、MAGE 和 RAID 训练的上下文转换器编码器相结合。我们的主要发现是,预处理根据应用的位置而发挥相反的作用:规范化训练语料库可以消除重复数据,将 35.4% 的 RAID 行折叠成干净同级的副本,并删除对抗性监督,而推理时规范化是一种有效的防御。改变两个位置的阶乘独立地将归一化推理的原始训练确定为最佳配置,在官方 RAID 隐藏测试中达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,同时在固定阈值下 HC3 Plus 和 MAGE 的平均平衡精度为 93.14%。增益仅限于 12 个攻击类别中的两个:同形文字和零宽度空间插入从 11.05% 和 1.12% 上升到 96.98%。相同的签名在不同架构的零样本检测器中重现,表明该效果属于攻击而不是我们的模型。我们还报告了两个负面结果:通过释义和监督对比学习(ConPara)增强语义不变性并不能改善最佳配置,并且手工制作的特征融合分支在分布中是惰性的,并且在分布之外是有害的。