论文

当 AI 基准趋于平顶:基准饱和的系统性研究

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

模型评测评测方法与指标

摘要

人工智能 (AI) 基准在衡量模型开发进度和指导部署决策方面发挥着核心作用。然而,许多基准测试很快就饱和了,这意味着它们无法再区分表现最好的模型,从而削弱了它们的长期价值。在这项研究中,我们分析了从主要模型开发人员的技术报告中选出的 60 个大语言模型 (LLM) 基准的基准饱和度。为了确定驱动饱和的因素,我们描述了涵盖任务设计、数据构建和评估格式的 14 个属性的基准。我们测试了五个假设,检验每个属性如何影响饱和率。我们的分析表明,近一半的基准表现出饱和状态,且比率随着基准的老化而增加。值得注意的是,隐藏测试数据(即公共数据与私人数据)没有显示出任何保护作用,而专家策划的基准比众包基准更好地抵抗饱和。我们的研究结果强调了哪些设计选择可以延长基准寿命,并为更持久的评估策略提供信息。