论文
Gate AI:LLM安全基准评估方法和结果
Gate AI: LLM Security Benchmark Evaluation Methodology and Results
摘要
已发布的 大语言模型 即时注入和越狱检测器评估通常存在两个系统缺陷:每个数据集的阈值调整和未公开的操作点。我们描述了一个解决这两个问题的评估工具。使用 5 倍交叉验证对正在评估的检测器在 16 个公共基准(12,111 个样本)进行评分。 StratifiedKFold(按行)是头条通;并行 StratifiedGroupKFold 传递复合键(父提示 id 加上 MinHash + LSH 在 Jaccard $\gtrsim 0.8$ 处的近重复簇)作为泄漏溢价诊断与它一起运行。在保留的折叠上选择单个全局操作点(最大 F1 受 FPR $\leq 1\%$ 影响)并统一应用于每个数据集,因此每个数据集的结果反映一个阈值而不是每个基准优化。通过一系列诊断(留一数据集交叉验证、随机标签控制、对抗性验证、排列特征重要性、长度偏差相关性、分类器头一致性、跨源近重复检测、阈值可转移性、训练与 OOF 一致性和释义不变性探针)来检查泛化性,大多数具有定量通过阈值,其余具有规定的失败模式。对于每次外部比较,检测器的阈值都会根据竞争对手公布的误报率重新调整,以便在匹配的操作点评估头对头值。