论文
安全基准对评判模型与提示配置有多敏感?
How Sensitive Are Safety Benchmarks to Judge Configuration Choices?
摘要
HarmBench 等安全基准依赖 LLM 判断器将模型响应分类为有害或安全,但判断配置(即判断模型和判断提示的组合)通常被视为固定的实现细节。我们证明这个假设是有问题的。使用 2 x 2 x 3 因子设计,我们沿着两个轴、评估结构和指令框架构建 12 个判断提示变体,并使用单个判断模型 Claude Sonnet 4-6 应用它们,在六个目标模型和 400 个 HarmBench 行为上产生 28,812 个判断。我们发现,在保持判断模型不变的情况下,仅提示措辞就可以将测量到的有害反应率改变高达 24.2 个百分点,甚至在条件内表面重新措辞也会导致高达 20.1 个百分点的波动。模型安全排名适度不稳定,平均 Kendall tau = 0.89,类别级别敏感度范围从版权的 39.6 个百分点到骚扰的 0 个百分点。使用三个判断模型的补充多判断实验表明,判断模型的选择进一步增加了方差。我们的结果表明,法官提示措辞是安全基准测试中测量方差的一个重要来源,此前未得到充分审查。