论文

BenchScope:你的基准能提供多少独立信号?

BenchScope: How Many Independent Signals Does Your Benchmark Provide?

模型评测评测方法与指标

摘要

AI 评测套件常常报告许多分数,却不检查这些分数是否携带独立信息。我们提出有效维度(Effective Dimensionality, ED),即中心化基准分数谱的参与率(participation ratio),作为测量广度的快速、总体条件化的上界诊断量。在 8 个领域的 22 个基准、超过 8,400 次模型评估上以逐实例粒度应用 ED 后,我们发现冗余相当可观:包含六项分数的 Open LLM Leaderboard 的表现约等同于两条有效测量轴(ED = 1.7),BBH 与 MMLU-Pro 几乎可以互换(rho = 0.96,且在七个子群体上保持稳定),而现有基准之间的测量广度差异超过 20 倍。我们证明,在匹配维度的控制条件下 ED 的相对排名保持稳定,并且 ED 可以标记套件中的冗余组件、监控性能条件化的压缩,并指导基准维护。由于二值谱会高估绝对的潜在维度,我们将 ED 解读为一种筛查性统计量而非字面意义上的因子数量,并用零假设、信度与饱和度分析加以补充。我们提供了 22 个基准的参考图谱和一套四步诊断流程,基准维护者只需一个分数矩阵和几行代码即可运行。

BenchScope:你的基准能提供多少独立信号?:论文配图
图 1:Open LLM Leaderboard v2 中的冗余结构。 (a) 成对相关矩阵(全部 4,576 个模型群体)显示,六分套件的行为大致类似于两个有效测量轴 (ED=1.7\text{ED}=1.7):BBH 和 MMLU-Pro 几乎重复 (ρ=0.96\rho=0.96),而其他对仅弱相关(例如,IFEval–MuSR: ρ=0.32\rho=0.32)。 (b) 子集特定模式(仅 n=188n=188):在精选子集中,MATH 和 MuSR 呈负相关(ρ=−0.64\rho=-0.64);在整个总体中,相关性为正(ρ=0.50\rho=0.50;见图 5)。