论文

通过隐式奖励模型对 LLM 生成的文本进行零样本检测

Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型 (LLM) 在各种任务中表现出了卓越的能力。然而,它们生成类似人类文本的能力引起了人们对潜在滥用的担忧。这强调需要可靠且有效的方法来检测 LLM 生成的文本。在本文中,我们提出了 IRM,一种新颖的零样本方法,利用隐式奖励模型进行 LLM 生成的文本检测。这种隐式奖励模型可以从公开可用的指令调整模型和基础模型中导出。以前基于奖励的方法依赖于偏好构建和特定任务 微调。相比之下,IRM 既不需要收集偏好,也不需要额外的训练。我们在 DetectRL 基准上评估 IRM,并证明 IRM 可以实现卓越的检测性能,在 LLM 生成的文本检测中优于现有的零样本和监督方法。