论文

检测人机合著文本中的LLM生成token

Detecting LLM-Generated Tokens in Human--LLM Coauthored Text

模型评测评测方法与指标

摘要

人机协作写作的兴起催生对细粒度检测方法的需求:在混合署名文档中定位可能的LLM生成内容。现有LLM生成文本检测方法主要聚焦文档级分类,无法识别文本哪些部分由LLM生成。本文引入应对这一迫切需求的新方法:方法在token级——现代语言模型的自然单元——操作,建立在既有token级检测分数之上。关键思想是平滑相邻token分数以降低其变异性,同时使用自适应的Lepski型规则按局部署名结构选择带宽。方法实现简单、无需token级标注数据训练。理论上,我们刻画该权衡并证明所提方法在估计底层信号上取得有利的均方误差表现。实证上,我们在合成数据集与真实数据集上相对广泛基线展示方法的强劲表现。我们还部署了一个实现该方法的公开可访问网站。

检测人机合著文本中的LLM生成token:论文配图
图 1:Lepski 针对候选带宽 k1<k2<⋯<k5k_{1}<k_{2}<\dots<k_{5} 的带宽选择规则的图示。每个候选带宽 kik_{i} 都会产生局部估计(蓝点)和置信区间(黑色垂直区间)。绿色带表示置信区间的交集,从最小带宽的置信区间开始一直到最大可接受的带宽。莱普斯基规则选择该交集非空的最大带宽。这里,选择的带宽是k4k_{4}。