论文

AI模型建造者不稳定的指标与基准化文化

Unsteady Metrics and Benchmarking Cultures of AI Model Builders

模型评测评测方法与指标

摘要

确立和比较基础与生成式AI模型能力的主要方式已从同行评审文献转向新闻稿和公司博客文章,模型建造者在其中突出展示其模型在选定基准上的结果。这些材料如今在很大程度上为研究者和公众定义了最先进水平。尽管地位显赫,模型建造者选择突出哪些基准、以及通过这种选择传达了什么,却少有检视。为开展调查,我们介绍并开源Benchmarking-Cultures-25,一个收录2025年11家主要AI建造者139次模型发布所突出的231个基准的数据集,并附带一个交互式数据探索工具。我们的分析揭示了一个碎片化、跨模型可比性有限的评估格局:63.2%被突出的基准仅由单一建造者使用,38.5%仅出现在一次发布中。只有少数基准获得广泛使用(例如GPQA Diamond、LiveCodeBench、AIME 2025)。此外,不同建造者依据自身叙事给基准赋予不同的能力标签。为厘清这些相互冲突的呈现,我们开发了一个统一分类法,依据基准作者声称的测量对象,把各异的术语映射到一个共享的被测信号框架。“通用知识应用”是第二大热门却定义模糊的类别。定性分析显示,许多此类基准弱化构念效度,而是把结果框定为迈向AGI的进展指标。其作者声称广泛测量知识或推理,实际主要评估STEM学科(尤其是数学)。我们认为,被突出的基准与其说是标准化测量工具,不如说是灵活的叙事装置,优先考虑市场定位而非科学评估。数据:https://hf.co/datasets/matybohacek/benchmarking-cultures-25;工具:https://bench-cultures.net。

AI模型建造者不稳定的指标与基准化文化:论文配图
图 1. 模型构建者在前 5 个“编码”基准中规定的能力。该图显示了模型发布者为跨模型发布的基准规定的能力类别的数量。