论文

当模型比裁判更聪明时基准即饱和

Benchmarks Saturate When The Model Gets Smarter Than The Judge

模型评测基准与评测资源

摘要

基准是追踪大语言模型(LLM)发展的重要工具,但数据集和评估方法中的不准确持续削弱其有效性。在此,我们提出Omni-MATH-2,Omni-MATH数据集的人工修订版,包含一个干净的精确答案子集(n=4181)和一个带标签的非标准子集(n=247)。每个问题都经过审计以确保LaTeX可编译、可解且可验证,这包括补充缺失的图形或信息、标注需要证明、估计或图像的问题,并清除冗余。这一过程显著降低了数据集引入的噪声,从而提供对模型性能更精确的评估。该标注数据集还使我们能够通过比较GPT-5 mini与原始Omni-Judge来评估裁判引入的噪声,揭示两个裁判在干净和带标签问题子集上的显著分歧。专家标注显示,在裁判分歧中Omni-Judge在96.4%的情况下是错误的,表明其无法区分模型能力,甚至在基准饱和之前就已如此。随着问题变得更具挑战性,我们发现越来越称职的裁判变得必不可少,以防止裁判错误掩盖模型之间的真实差异。最后,两个裁判都无法识别带标签问题子集的现存失败模式,这表明数据集质量和裁判可靠性对构建准确的模型性能基准都至关重要。

当模型比裁判更聪明时基准即饱和
图1:Omni-MATH 数据集 [1] 的清理过程概览。首先,我们检查 4,428 个 LaTeX 编写的问题陈述的可编译性,并用 python 将其转换为有效的 LaTeX 代码。接着,一位博士水平的数学家对编译后的 pdf 文件人工审查了两遍,检查每个问题的可解性与可验证性。在此过程中,在可获得时通过人工浏览或 GPT-5.1 补充缺失信息,并将图像添加到数据文件夹中。此外,为每个包含图像、证明(proof)或估算(estimation)的问题添加标签。退化问题被加上 should delete 标签。我们将所得数据集称为 Omni-MATH-2,其条目数与原始 Omni-MATH 数据集相同(647 个经编辑的问题(14.6%),247 个被标记为非标准(5.6%),见表 1)。Omni-MATH-2-Filtered 数据集(n=4,181)是清理后问题的子集,排除了被标记的问题。这使其适用于精确答案判定。