论文
一旦响应,始终响应:通过潜在提示恢复检测 LLM 生成的文本
Once a Response, Always a Response: Detecting LLM-generated Text via Latent Prompt Restoration
摘要
大语言模型 (LLM) 可以大规模生成流畅且令人信服的文本,从而为错误信息传播、教育滥用和平台治理带来越来越大的风险。这些问题使得对机器生成文本的稳健检测变得越来越必要。最近的零样本检测器主要利用基于概率的统计差异,但它们没有明确解释 LLM 的训练过程,这使得独特的生成机制未充分建模并限制了检测的鲁棒性。为了解决这个问题,我们提出了 EchoPrompt,一种基于潜在提示恢复的 无需训练 检测器。我们的主要直觉是,机器生成的文本通常是根据上游提示生成的,并且可以通过预先添加统一的通用前缀来部分重新激活这种隐藏的依赖关系。具体来说,EchoPrompt 恢复通用的助理响应上下文,使用指令调整模型测量诱导的似然增益,根据相应的基本模型对其进行校准,并将所得差异聚合成量化潜在提示依赖性的分数。大量实验表明,EchoPrompt 在零样本检测器中实现了最先进的性能,同时在具有挑战性的评估设置中保持了强大的鲁棒性。