论文
BenchScope:你的基准能提供多少独立信号?
BenchScope: How Many Independent Signals Does Your Benchmark Provide?
摘要
AI 评测套件常常报告许多分数,却不检查这些分数是否携带独立信息。我们提出有效维度(Effective Dimensionality, ED),即中心化基准分数谱的参与率(participation ratio),作为测量广度的快速、总体条件化的上界诊断量。在 8 个领域的 22 个基准、超过 8,400 次模型评估上以逐实例粒度应用 ED 后,我们发现冗余相当可观:包含六项分数的 Open LLM Leaderboard 的表现约等同于两条有效测量轴(ED = 1.7),BBH 与 MMLU-Pro 几乎可以互换(rho = 0.96,且在七个子群体上保持稳定),而现有基准之间的测量广度差异超过 20 倍。我们证明,在匹配维度的控制条件下 ED 的相对排名保持稳定,并且 ED 可以标记套件中的冗余组件、监控性能条件化的压缩,并指导基准维护。由于二值谱会高估绝对的潜在维度,我们将 ED 解读为一种筛查性统计量而非字面意义上的因子数量,并用零假设、信度与饱和度分析加以补充。我们提供了 22 个基准的参考图谱和一套四步诊断流程,基准维护者只需一个分数矩阵和几行代码即可运行。
