论文

对齐印记:基于可证明偏好差异的零样本AI生成文本检测

Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy

模型评测评测方法与指标

摘要

检测AI生成文本是一个重要但具有挑战性的问题。现有基于似然的检测方法往往对内容复杂度敏感,性能可能不稳定。本文的关键洞察是:现代大语言模型(LLM)经历对齐(包括微调与偏好调优),留下可测量的分布印记。我们将对齐过程抽象为一系列约束优化步骤,从理论上推导出该印记,表明对数似然比可自然分解为隐式指令偏差与偏好奖励。我们将该量称为对齐印记(Alignment Imprint)。此外,为缓解高熵区域的不稳定性,我们提出对数似然对齐偏好差异(LAPD),一种基于对齐印记的标准化信息加权统计量。我们提供统计保证,证明基于对齐的统计量在性能上优于Fast-DetectGPT。我们还从理论上证明,当对齐模型与基座模型分布相近时,LAPD严格优于未加权的对齐分数。大量实验表明,LAPD相对最强现有基线取得45.82%的提升,在所有设置下均带来大且一致的增益。

对齐印记:基于可证明偏好差异的零样本AI生成文本检测:论文配图
图 1:概述。 (A) 普通对数似然被内在内容复杂性所混淆(例如,简单的人类编写的文本可能比复杂的人工智能生成的文本获得更高的可能性),从而破坏了可靠的检测。 (B) LLM 对齐流程会引起规定的分布变化,从而在基础模型和对齐模型之间产生系统性变化。 (C) 检测管道。给定输入文本,我们计算基本模型和对齐模型下的对数似然。它们的差异被定义为原始对齐印记(RAI)。在使用信息加权和标准化之后,我们提出了对数似然对齐偏好差异(LAPD),它放大了对齐引起的信号并实现鲁棒检测。