论文

SV-Detect:带有引导向量的 AI 生成文本检测

SV-Detect: AI-generated Text Detection with Steering Vectors

模型评测评测方法与指标

摘要

在分布转移(例如跨域传输、源模型和编辑攻击)的情况下,检测人工智能生成的文本尤其困难。我们提出了一种人工智能生成的文本检测器,该检测器基于从冻结语言模型的隐藏表示中提取的转向向量。在每一层,我们构建一个将人类编写的文本与人工智能生成的文本分开的方向,并通过与这些方向的逐层对齐来表示每个输入。对这些投影特征进行训练的轻量级分类器会产生最终的检测分数。我们的方法在分布内和分布转移下都实现了强大的性能,包括跨域、源模型和机器编辑转换(例如抛光和重写)。解释分析表明,学习到的方向与可识别的风格线索一致,同时捕获表面特征之外的大量附加信号。这些结果将人工智能生成的文本检测定位为表示空间探测问题,并表明转向向量提供了一种简单而有效的解决方案。