论文
当模型比裁判更聪明时基准即饱和
Benchmarks Saturate When The Model Gets Smarter Than The Judge
摘要
基准是追踪大语言模型(LLM)发展的重要工具,但数据集和评估方法中的不准确持续削弱其有效性。在此,我们提出Omni-MATH-2,Omni-MATH数据集的人工修订版,包含一个干净的精确答案子集(n=4181)和一个带标签的非标准子集(n=247)。每个问题都经过审计以确保LaTeX可编译、可解且可验证,这包括补充缺失的图形或信息、标注需要证明、估计或图像的问题,并清除冗余。这一过程显著降低了数据集引入的噪声,从而提供对模型性能更精确的评估。该标注数据集还使我们能够通过比较GPT-5 mini与原始Omni-Judge来评估裁判引入的噪声,揭示两个裁判在干净和带标签问题子集上的显著分歧。专家标注显示,在裁判分歧中Omni-Judge在96.4%的情况下是错误的,表明其无法区分模型能力,甚至在基准饱和之前就已如此。随着问题变得更具挑战性,我们发现越来越称职的裁判变得必不可少,以防止裁判错误掩盖模型之间的真实差异。最后,两个裁判都无法识别带标签问题子集的现存失败模式,这表明数据集质量和裁判可靠性对构建准确的模型性能基准都至关重要。
