论文
一种能力还是多种能力?测试前沿人工智能评估的经济有效性
One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
摘要
前沿模型排行榜现在根据经济基准对系统进行排名,测试模型执行从软件工程到银行工作流程等专业任务的能力,这些排名可以告知组织购买什么、监管机构审查什么以及对工作将如何变化的预期。这些基准是否衡量了一种不同于一般考试的能力,或者重新表达了随着模型改进而每个基准上升的一个轴,这是一个尚未研究的结构有效性问题。我们在 12 个基准的 421 个模型配置的哈希固定排行榜快照上进行了测试,其中有 4 个是经济的,将基准视为项目,将模型视为潜在变量模型中的受访者,有四个假设,并且在分析前固定了阈值。单个因素解释了 74.5% 的共同方差并跟踪模型发布日期 (R^2 = 0.505),因此能力的主导轴实质上是时间趋势;之前的工作控制了规模,而一旦删除日期,计算就几乎没有增加。删除日期趋势后,该份额会降低 14.9 个点,而每个基本模型一行会降低 24.1 个点。在预先确定的维度规则下,经济基准不形成明显的因素,但对每个折叠内的因素进行重新估计的留一基准测试表明,多因素表示比单个一般指数更好地预测保留的经济分数(汇总 Delta-MSE 0.037,95% bootstrap 区间 [0.019, 0.055])。因此,经济基准将增量预测信息添加到很大程度上由日期驱动的一般因素中,并且证据并不支持将它们视为独特的潜在能力。排行榜仍然是总体进展的合理指南,但相隔几个月发布的模型之间的大部分差距是日历上的,因此同期模型之间的小差距应该在被解读为能力差异之前进行日期调整。