论文
GuardNet:用于鲁棒提示注入防御的浅层神经网络集成策略
GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection
摘要
大型语言模型 (LLM) 已经改变了自然语言处理,但它们仍然容易受到提示注入 (PI) 和越狱 (JB) 攻击。此外,基准评估可能会受到污染和部分信息泄露的影响,从而影响性能估计。这项工作提出了 GuardNet,这是一种基于浅层神经网络 (BiLSTM) 集合的护栏系统,具有大约 4700 万个参数。我们研究了这样一个假设:对抗场景中的鲁棒性更多地取决于示例覆盖范围和阈值校准的多样性,而不是模型规模。结果表明,与轻量级检测器相比,GuardNet 实现了具有竞争力的性能,并且在低延迟下实现了高效率,尽管 Mistral-7B 和 Llama-3.1-8B 等较大的 LLM 仍然在盲 JBB-Behaviors 基准上的 F1 分数和 AUROC 方面取得了优异的性能。尽管如此,在阈值校准和声明部分信息泄漏的评估下,GuardNet 在盲数据集 (n = 200) 上实现了 0.747 的 AUROC,在专有基准 (n = 50) 上实现了 0.92 的 F1 分数。该系统在 CPU 上的平均运行延迟约为 50 毫秒,适合在成本和基础设施受限的生产环境中部署。