论文

击中移动目标:持续分布变化下 AI 文本检测的测试时间适应

Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

已部署的人工智能文本检测方法通常依赖于在训练时访问人类编写的文本和人工智能生成的文本的标记数据集。这种方法很容易受到部署后不断发生的三种类型的分布变化的影响,并且通常无法获得这些变化的标记数据:对抗性人性化、新发布的 LLM 以及人类写作中的时间漂移​​。同时,现有方法没有利用 LLM 使用的关键信号:推理时间同质性。我们提出了一种使用半监督学习的测试时间适应(TTA)方法,该方法通过利用推理时观察到的未标记样本之间的同质性来适应分布变化。根据经验,我们发现最先进的监督检测器在遇到人工智能生成的和人类书写的分布变化(无论是对抗性的还是自然的)时会系统性地失败,而半监督学习的测试时间适应在很大程度上是稳健的;例如,商业模型 Pangram 只能检测到 24.1% 的对抗性 AI 生成文本,而我们的测试时方法可以检测到 90.5%。我们确定测试时间适应是一种有前途的人工智能文本检测框架。我们在 https://github.com/kkr36/llm_detection 公开发布我们的代码(包括 模型训练、评估和绘图的代码)。