论文
检测人机合著文本中的LLM生成token
Detecting LLM-Generated Tokens in Human--LLM Coauthored Text
摘要
人机协作写作的兴起催生对细粒度检测方法的需求:在混合署名文档中定位可能的LLM生成内容。现有LLM生成文本检测方法主要聚焦文档级分类,无法识别文本哪些部分由LLM生成。本文引入应对这一迫切需求的新方法:方法在token级——现代语言模型的自然单元——操作,建立在既有token级检测分数之上。关键思想是平滑相邻token分数以降低其变异性,同时使用自适应的Lepski型规则按局部署名结构选择带宽。方法实现简单、无需token级标注数据训练。理论上,我们刻画该权衡并证明所提方法在估计底层信号上取得有利的均方误差表现。实证上,我们在合成数据集与真实数据集上相对广泛基线展示方法的强劲表现。我们还部署了一个实现该方法的公开可访问网站。
