论文

两个AI指标分道扬镳:会有什么不同吗

Two AI Metrics Diverged: Will it Make All the Difference?

模型评测评测方法与指标

摘要

随着指数算力缩放持续,前沿AI模型的能力会超过小固定预算开发者的可达范围吗?还是能力会收敛——"温和模型继承地球"?基于Gundlach等(2025b),我们展示答案取决于如何度量AI能力。我们讨论常规表现度量并显示:验证损失差距缩小,但在其他度量上前沿模型永远扩大领先。按性能度量相对训练(与推理)算力的函数形式分类——我们提供确定哪些度量有利于温和模型的紧凑数学条件,并证明有界性能度量总是如此。但仔细解读性能度量至关重要:许多常见有界度量有密切相关的无界对应度量(反之亦然)。确定领域中的适当度量是政策的前提——因为有界与无界度量可能暗示相反的政策响应。如果特定能力——如软件工程、合成生物学或修辞说服力——在我们关心的度量条件下是无界的,前沿级能力将可能集中于少数富裕参与者手中。反之,如果该能力有界,前沿级能力经温和模型扩散到大众手中。

两个AI指标分道扬镳:会有什么不同吗:论文配图
图 2:在两个相关指标上,前沿模型性能改进与估算的温和模型性能(更慢地遵循相同趋势,与 GPT-4 的前沿一致)之间的差距:METR 时间范围(Kwa 等人,2026)(上)和 4 分钟、1 小时和 4 小时任务的任务成功概率(下)。这两个指标都是根据相同的基本趋势生成的,但有些会导致温和的结果,有些则不会。这些结果是程式化的估计,而不是预测。