论文
超越重叠:估计基准暴露的因果效应
Beyond Overlap: Estimating the Causal Effect of Benchmark Exposure
摘要
评估材料进入训练的证据并没有揭示它对评估的影响有多大。这种区别使得受污染的基准分数难以解释:出处可以建立联系,但只有反事实才能量化归因于该联系的绩效。我们提出了 LeakScale,一个用于估计缺失量的干预框架。 LeakScale 创建新的可执行任务,这些任务需要公共任务中缺少且不可导出的私有、特定于家庭的信息,控制对该信息的访问,并估计可执行准确性中最终的控制调整变化。在 2,048 个独特系列、两个模型系列、两个可执行域和 262,144 代中,暴露提高了每个模型与域组合的准确性,增益范围为 +7.17 到 +27.31 个百分点。这些发现区分了两个经常被混淆的实证问题:基准接触是否发生以及报告的分数对其的依赖程度。 LeakScale 使后者可以直接测量。