论文

潜在诊断分类法:构建分类器并诊断其决策的框架,应用于即时注射检测

The Latent Diagnostic Taxonomy: A Framework for Constructing Classifiers and Diagnosing Their Decisions, Applied to Prompt Injection Detection

模型评测评测方法与指标

摘要

本文提出了一个框架,用于构建分类器作为保护层,并开发补充诊断来识别分类器的哪些置信决策是可信的。该框架,即潜在诊断分类法,包括 (i) 构建维度优化的分类器,其中嵌入维度是通过交叉验证的性能而不是先验固定来经验选择的,(ii) 定位相对较小的一组潜在支持向量(约占总训练示例的 29%),代表识别改变分类器预测标签的标记的有影响力的提示,以及 (iii) 利用这些标记及其相关的攻击强度来构建诊断分类学。该诊断分类法为标记需要不同处理的提示提供了端到端指南:安全地依赖分类器的决定;标记启发式偏差和启发式覆盖案例;路线上下文不足,需要进一步进行人员/安全审查。将框架应用于在公共提示注入数据集上训练的分类器,我们发现其置信决策的很大一部分(约 77%)对于删除单个标记并不稳健,并且这种脆弱性分为两种不同的失败模式:置信度校准失败和真正可利用的捷径。对于分类的每个区域,我们还推荐了修复诊断提示的策略。我们将框架描述为一系列步骤,展示每个步骤的运作方式。