论文
对齐印记:基于可证明偏好差异的零样本AI生成文本检测
Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy
摘要
检测AI生成文本是一个重要但具有挑战性的问题。现有基于似然的检测方法往往对内容复杂度敏感,性能可能不稳定。本文的关键洞察是:现代大语言模型(LLM)经历对齐(包括微调与偏好调优),留下可测量的分布印记。我们将对齐过程抽象为一系列约束优化步骤,从理论上推导出该印记,表明对数似然比可自然分解为隐式指令偏差与偏好奖励。我们将该量称为对齐印记(Alignment Imprint)。此外,为缓解高熵区域的不稳定性,我们提出对数似然对齐偏好差异(LAPD),一种基于对齐印记的标准化信息加权统计量。我们提供统计保证,证明基于对齐的统计量在性能上优于Fast-DetectGPT。我们还从理论上证明,当对齐模型与基座模型分布相近时,LAPD严格优于未加权的对齐分数。大量实验表明,LAPD相对最强现有基线取得45.82%的提升,在所有设置下均带来大且一致的增益。
