论文

Exons-Detect:通过隐藏状态差异识别和放大 Exons 词元,以实现强大的 AI 生成的文本检测

Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型 的快速发展使得人类书写和人工智能生成文本之间的界限日益模糊,引发了错误信息传播、作者身份模糊和知识产权威胁等社会风险。这些担忧突出表明迫切需要有效且可靠的检测方法。虽然现有的 无需训练 方法通常通过将 词元级 信号聚合到全局分数中来实现强大的性能,但它们通常假设统一的词元贡献,这使得它们在短序列或局部词元修改下的鲁棒性较差。为了解决这些限制,我们提出了 Exons-Detect,这是一种基于外显子感知标记重新加权视角的 AI 生成文本检测的 无需训练 方法。 Exons-Detect 通过测量双模型设置下的隐藏状态差异来识别和放大信息丰富的外显子标记,并根据生成的重要性加权标记序列计算可解释的翻译分数。实证评估表明,Exons-Detect 实现了最先进的检测性能,并对对抗性攻击和不同的输入长度表现出强大的鲁棒性。特别是,与 DetectRL 上最强的先前基线相比,它的平均 AUROC 相对提高了 2.2%。