论文
SafeReview:捍卫基于 LLM 的审核系统免受对抗性隐藏提示的影响
SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
摘要
随着 大语言模型 (LLM) 越来越多地融入学术同行评审,它们容易受到对抗性隐藏提示的影响,即嵌入在提交内容中以操纵结果的对抗性指令,对学术诚信构成了严重威胁。我们提出 SafeReview,这是一种共同进化的对抗训练框架,用于保护基于 LLM 的同行评审系统免受此类攻击。 SafeReview 联合训练 Generator 模型来创建复杂的攻击提示,并联合训练 Defender 模型以在对抗性操纵下保持审查完整性。生成器经过优化,可产生越来越有效的即时注入,而防御者则通过基于偏好的训练得到加强,以保持干净和受攻击提交之间的一致审查。实验结果表明,与静态防御相比,SafeReview 提高了针对自适应提示注入攻击的鲁棒性,更好地保留了受到攻击的论文排名,并且可以跨攻击者架构进行泛化。这些结果证明了共同进化训练作为确保 LLM 辅助同行评审的基础的潜力。