论文
AI Cartography:绘制AI基准生态系统的潜在格局
AI Cartography: Mapping the Latent Landscape of AI Benchmark Ecosystems
摘要
尽管排行榜聚合分数驱动着AI发展,但其中包含大量测量噪声,其来源与量级尚未被量化,导致人们无法判断排名究竟反映真实能力差异,还是评估假象。我们提出一个测量AI基准生态系统潜在格局的框架。将验证性因子分析(CFA)与概化理论应用于Open LLM Leaderboard的4000多个模型,我们分解排名方差的来源并确立:(1)当前报告实践所假设的结构低估了基准之间关系的强度;(2)存在排行榜条目间局部依赖的证据,这削弱了在现行评分体系下将基准用作测量工具的做法;(3)在此情境中,贡献者元数据能解释的排名相关方差(约9%)多于架构或部署类别;(4)显分数"缩放定律"斜率的信度较低(R_β=0.53);相比之下,潜在一般因子规模斜率在各种生态系统控制变量下高度稳定(R_g=0.97)。我们能够就基准动态提供独特洞见,例如哪些基准是LLM规模的函数,哪些可能受到后训练实践的反向影响。我们提供可操作的诊断方法,用于判断基准排名在多大程度上可信,以及如何改进基准设计。