论文

CleanScore:具有负面控制和敏感性界限的黑盒基准审计

CleanScore: Black-Box Benchmark Audits with Negative Controls and Sensitivity Bounds

模型评测评测方法与指标

摘要

公共基准分数可能反映技能、之前接触过的问题或两者兼而有之,并且对于大多数模型来说,训练数据是未知的。我们推出 CleanScore,这是一种仅使用评分输出的黑盒审核。每个基准问题都成为一个父项目,具有一个公共表格和两个独立编写的新表格,保留其数字、事实和答案。审计报告了公共形式优势的区间而不是判决,并且具有明确传输半径的私人负控制银行将风险与普通形式不匹配分开。一项注册的受控暴露实验可检测植入的暴露并在新鲜形式的暴露下保持安静。对 200 个 GSM8K 和 200 个 ARC-Challenge 项目的五个开放模型进行的注册审核发现,没有暴露一致的优势,将表面形状膨胀限制在五个点以下。注册的阳性对照随后会限制此类无效值的含义。泄漏项目对模型从未见过的释义的准确性提高几乎与泄漏措辞的准确性一样高,使得 52% 到 110% 的影响对于释义审核来说是不可见的。在 ARC 上,植入的 49 分优势显示可观察到的差距为 -0.020,并且在四个训练种子中重写主干和选项后,大约 20 分仍然存在。表面形式的零界远小于污染审计一词所暗示的范围。