论文
两个AI指标分道扬镳:会有什么不同吗
Two AI Metrics Diverged: Will it Make All the Difference?
摘要
随着指数算力缩放持续,前沿AI模型的能力会超过小固定预算开发者的可达范围吗?还是能力会收敛——"温和模型继承地球"?基于Gundlach等(2025b),我们展示答案取决于如何度量AI能力。我们讨论常规表现度量并显示:验证损失差距缩小,但在其他度量上前沿模型永远扩大领先。按性能度量相对训练(与推理)算力的函数形式分类——我们提供确定哪些度量有利于温和模型的紧凑数学条件,并证明有界性能度量总是如此。但仔细解读性能度量至关重要:许多常见有界度量有密切相关的无界对应度量(反之亦然)。确定领域中的适当度量是政策的前提——因为有界与无界度量可能暗示相反的政策响应。如果特定能力——如软件工程、合成生物学或修辞说服力——在我们关心的度量条件下是无界的,前沿级能力将可能集中于少数富裕参与者手中。反之,如果该能力有界,前沿级能力经温和模型扩散到大众手中。
