论文

使用 LLM 作为法官和混合模型进行快速攻击检测

Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models

AI 基础设施AI安全与内容治理基础设施

摘要

即时攻击,包括越狱和即时注入,对 大语言模型 (LLM) 系统构成严重的安全风险。在生产中,护栏必须在严格的低延迟约束下缓解这些攻击,从而导致部署差距,轻量级分类器和基于规则的系统难以在分布转移下泛化,而基于 LLM 的大容量判断器对于实时执行来说仍然太慢或成本太高。在这项工作中,我们研究了轻量级通用 LLM 是否可以在现实生产限制下可靠地充当安全法官。通过仔细的提示和输出设计,轻量级LLM被引导通过结构化推理过程,包括明确的意图分解、安全信号验证、危害评估和自我反思。我们在精心策划的数据集上评估我们的方法,该数据集结合了来自现实世界聊天机器人的良性查询和通过自动红队(ART)生成的对抗性提示,涵盖了多样化和不断发展的模式。我们的结果表明,通用LLM,例如gemini-2.0-flash-lite-001,可以作为实时护栏的有效低延迟判断器。此配置目前在生产中部署为新加坡公共服务聊天机器人的集中护栏服务。我们还评估了模型混合(MoM)设置,以评估聚合多个 LLM 判断是否可以相对于单模型判断提高即时攻击检测性能,但仅观察到适度的增益。