论文

AEyeDE:用于人工智能生成文本检测的基于注意力的归因框架

AEyeDE: An Attention-Based Attribution Framework for AI-Generated Text Detection

AI 基础设施AI安全与内容治理基础设施

摘要

随着现代语言模型接近人类水平的流畅性,并且可以逃避依赖于表面统计或基于可能性的信号的检测器,检测人工智能生成的文本变得越来越具有挑战性。我们提出 \textsc{AEyeDE},这是一种归因驱动的人类人工智能作者身份检测方法,利用模型注意力作为判别信号。具体来说,我们使用具有白盒访问功能的 \emph{proxy} Transformer 模型提取人类和人工智能生成的文本的基于注意力的归因矩阵,并训练轻量级卷积神经网络以从这些归因图中学习表示。在编码器-解码器翻译设置中,我们的方法始终优于纯文本基线。在仅解码器设置中,它在特定于生成器的检测中表现强劲,在标准基准上保持竞争力,并在跨数据集传输和替代拼写扰动下表现出鲁棒性。我们进一步表明,注意力图表现出重复出现的局部结构,其相对频率在跨数据集和代理模型的人类和人工智能生成的文本之间始终存在差异。这些发现表明,基于注意力的归因图为人工智能生成的文本检测提供了补充和可解释的信号。我们将公开代码以支持未来的研究。