论文

安全性还是能力?Agent安全基准的效度审计

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

模型评测评测方法与指标

摘要

Agent安全基准衡量不同的行为,但其分数常被互换使用,仿佛衡量的是一个称为Agent安全性的共同属性。我们将R-Judge、InjecAgent、AgentHarm和AgentDojo这四个基准作为效度审计对象,使用各自官方实现与作者提供的评分器评估最多22个模型,并在统一协议下自行测量MMLU和GPQA,形成能力综合指标。问题首先出在度量上:任何以F1评分的二元轨迹判断基准中,“总是判正”策略都能达到F1=2π/(1+π);在R-Judge中为0.690,高于21个真正进行区分的模型中的五个。三个覆盖较广的基准对同一组18个模型给出不同排序,相关权衡受小样本面板影响:R-Judge特异性与AgentHarm安全性的相关系数在n=7时为-0.64,在n=18时为+0.02;围绕这一接近零的总体值,随机七模型子集有四分之一达到|ρ|≥0.5。留出效度取决于选择哪一种结果。能力预测任务成功(ρ=+0.60),却与失对齐安全性负相关(ρ=-0.44,n=21)。在配对的20模型面板上,两者差异Δ=-1.00(95%置信区间[-1.48,-0.49],p<0.001),且经逐组织留出及组织聚类自助分析后仍成立。在扩展到41个模型时,失对齐相关性减弱到-0.16(95%置信区间[-0.54,+0.22]),越狱相关性增强到+0.34,但变化均不显著。控制能力后,AgentHarm与三模板越狱安全性的留出关联最强,ρ=+0.72。不过两个工具都评估有害服从,因此支持的是趋同效度,而非通用安全性。安全声明至少必须明确基准、度量、目标行为与模型面板。

安全性还是能力?Agent安全基准的效度审计:论文配图
图3:审计所依据的证据矩阵:最多46个模型乘以9项测量(两项能力锚点、四个被审计基准、三项留出标准),共262个模型与测量项组合。单元格为每项测量经最小值至最大值归一化的得分,灰色表示未运行。41个模型的锚定面板之外的行,是按预先规定的遥测门槛排除于分析之外的模型(附录A.6)。各行按能力排序:上方的2026扩展模型只在锚点和两项无需工具调用 Harness 的聊天标准上评分;四个被审计基准仍在原面板上运行。能力锚点与 R-Judge、InjecAgent 得分共同变化,安全标准却不始终随之变化。