论文
Telescope:通过测量词元重复概率来改进 LLM 生成内容的零射击检测
Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability
摘要
将 大语言模型 (LLM) 生成的文本与人类书写区分开来是一项关键且困难的挑战。虽然 LLM 接受过像人类一样写作的训练,但我们假设这种训练留下了不可磨灭的印记。 LLM 在训练的早期就对标记重复产生了特别强烈的厌恶。这种偏见作为“残留启发式”(一种发展产物)持续存在,在 LLM 生成的文本中被激活,将 LLM 与人类书写分开。为了探究这种现象,我们引入了 Telescope Perplexity,这是一种评估模型 $P(s_i | s_{1:i})$ 标记重复的指标。我们的实证研究表明,Telescope Perplexity 特征在 预训练 早期出现,并且 Telescope Perplexity 根据经验实现了高效的零样本 LLM 检测。我们展示了跨不同数据集(包括我们引入的现代评估集)、参考模型和扰动方案的最先进或有竞争力的性能,并且比其他方法更高效。