论文

您不需要运行每个评估

You Don't Need to Run Every Eval

模型评测评测方法与指标

摘要

现代模型发布会报告 40 多个基准的分数,并且之前会多次运行相同的评估:跟踪训练进度、比较设计选择并选择发布的检查点。但是我们需要运行每个 eval 吗?我们在 133 个基准(2,604 个单元格,23.3% 填充)上编译了 84 个前沿模型的公共得分矩阵,发现它大约为 2 级:模型在所有基准上的得分很大程度上仅由两个数字决定。我们通过两种方式证实了这一点:(i) 使用两个因素可以最好地恢复隐藏在矩阵中的分数,(ii) 这两个因素已经解释了模型之间在它们共享的基准上超过 90% 的变异。在此基础上,我们设计了 BenchPress:一种 logits 空间秩 2 矩阵补全方法,可将保留分数恢复到 4.6 分以内。使用 BenchPress,我们找到了五个基准测试的子集 {GPQA-D、HLE、Codeforces、MMLU-Pro、ARC-AGI-1},可以将模型公共记分卡的其余部分恢复到 3.93 分以内。对于更严格的评估预算,更便宜的集合 {GPQA-D、MMLU-Pro、Aider Polyglot、MATH-500、AIME 2026} 可以将模型的评估值预测到 4.55 以内。最后,我们确定影响预测可靠性的因素,并将这些因素与预测变量的分歧结合起来,以量化预测何时可信。我们在 Github 上发布了分数矩阵,即用于重现我们所有实验的代码。