论文

超越准确率:作为LLM安全裁判可靠性检验的策略不变性

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

模型评测评测方法与指标

摘要

LLM-as-a-Judge 管道已成为代理人安全事实上的评估者,但现有基准将其判决视为真实代理,而不检查判决是否取决于代理人的行为或仅取决于评估政策的措辞方式。我们认为,任何值得信赖的安全法官都必须满足我们称为策略不变性的基本属性,并将其操作为三个可测试的原则:经过认证的等效重写下的标题语义不变性、有意从严格到宽松的转变下的标题阈值不变性以及模糊性感知校准,以便判决不稳定集中在真正模糊的情况下。将这些原则实例化为压力测试协议,由四名代理级法官根据 ASSEBench 和 R-Judge 绘制的轨迹进行,我们发现了一种以前无法测量的失败模式:今天的法官以相当的强度对有意义的规范转变和无意义的结构重写做出反应,并且无法区分两者。内容保留策略重写使高达 9.1% 的判决翻转高于基线抖动,并且所有观察到的翻转中有 18-43% 发生在此类重写下的明确情况下,因此现有的安全评分将代理的操作与评估器的提示方式混为一谈。除了诊断之外,我们还贡献了策略不变性分数和法官卡报告协议,这些协议揭示了法官可靠性的数量级分布,而这对于仅准确性的排行榜来说是不可见的。我们发布协议和代码,以便未来的代理安全基准可以审核自己的评估者,而不是默认信任他们。

超越准确率:作为LLM安全裁判可靠性检验的策略不变性:论文配图
图 1:策略不变性的三原则压力测试。给定相同的代理轨迹,原则 1 应用经过认证的等效策略重写(判决不应翻转),原则 2 应用严格到宽松的阈值转换(翻转应该是大的和有方向的),原则 3 将模糊项目的翻转与内容保留重写下明确项目的翻转分开,后者是测量失败。