论文
脚手架下的安全:评估条件如何塑造所测安全性
Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety
摘要
安全基准单独评估语言模型,通常使用多项选择格式;生产部署将这些模型包装在代理支架中,通过推理跟踪、批评代理和委托管道重组输入。我们报告了一项最大的支架对安全性影响的对照研究(N = 62,808;六个前沿模型,四种部署配置),结合了预注册、评估者盲法、等效性测试和规格曲线分析。地图缩减脚手架会降低测量的安全性(NNH = 14),但三种脚手架架构中的两种将安全性保持在实际有意义的范围内。对map-reduce退化的研究揭示了一个更深层次的测量问题:对相同的项目从多项选择转换为开放式格式会使安全分数改变5-20个百分点,比任何支架效应都要大。格式内支架比较与我们预先注册的 +/-2 pp TOST 裕度下的实际等效性一致,将评估格式而不是支架结构作为操作变量。模型 x 脚手架相互作用在相反方向上跨越 35 pp(一个模型在 map-reduce 下因阿谀奉承而降级为 -16.8 pp,而另一个模型在同一基准上提高了 +18.8 pp),排除了有关脚手架安全性的普遍说法。通用性分析得出 G = 0.000:模型安全排名在基准测试中完全相反,以至于没有复合安全指数能够实现非零可靠性,从而使每个模型、每个配置的测试成为必要的最低标准。我们将所有代码、数据和提示作为 ScaffoldSafety 发布。
