论文

词元似然数组回归:用于成员推断和AI文本检测

Token-Level Likelihood-Array Regression for Membership Inference and AI-Generated Text Detection

模型评测评测方法与指标

摘要

成员推理询问文本是否用于训练语言模型,而人工智能生成的文本检测则询问文本是否由语言模型生成而不是由人类编写。现有的基于可能性的方法通常将 词元级 概率压缩为几个预先指定的分数,最常见的是仅使用以完整的先前上下文为条件的概率。我们提出似然数组回归(LAR),它评估嵌套左上下文窗口下的每个目标标记,并将所得的似然派生特征组织到结构化数组中。在跨不同长度的文本对齐数组后,LAR 会了解检测信息如何随上下文尺度、标记位置和似然特征而变化。 LAR-1 聚合了来自各个对齐单元的学习贡献,而 LAR-2 添加了由跨上下文长度的相同目标标记的评估对形成的二阶特征。对于路径内二次模型,我们建立匹配的极小极大下限和上限,表征有限维近似和随机平方投影的误差,并推导预言谱筛获得极小极大率的条件。在多种评分语言模型中,LAR 显着改善了基于可能性的基线的成员推理和 AI 生成的文本检测。分析进一步表明,较短上下文的可能性包含超出传统全上下文概率的信息,而二阶特征为隶属推理提供了额外的收益。