论文

即时注入检测与制度相关:具有可解释结构信号的部署感知评估

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

模型评测安全与风险评测

摘要

即时注入对 大语言模型 的安全部署构成了严重威胁,但现有的检测方法通常是在有限的设置下进行评估,无法反映现实世界的操作限制。在这项工作中,我们使用多模型和多机制实验框架对即时注入检测进行部署感知评估。我们比较了词汇、语义、结构和基于 Transformer 的检测器,包括多个分布外设置、重复数据分割以及排名和阈值部署指标。我们引入了可解释的结构信号,这些信号捕获层次结构覆盖、系统提示欺骗、角色重新定义和逃避模式,并评估它们在稀疏模型中以及与强大的编码器基线相结合的贡献。我们的结果表明,检测性能高度依赖于机制,并且对阈值选择敏感,没有单一模型在所有设置中占主导地位。基于 Transformer 的模型实现了最强的整体性能,而结构信号在某些情况下提供了适度但一致的增益,并在更困难的情况下改善了低误报率行为。这些发现凸显了排名性能和部署有效性之间的差距,并强调了在现实操作限制下评估即时注入防御的重要性。代码将被发布。