论文
随机机器的弹着分组:精度而非能力才是AI系统的前沿指标
Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems
摘要
前沿语言模型在能力——即其最好或平均输出所能达到的水平——上进行比较、营销和基准测试。我认为这测错了维度。这些模型的准确率已经饱和:其平均输出能够命中目标。如今在实践中区分一个系统与另一个系统的,是精度:在重复、完全相同的请求中,其输出围绕目标的集中程度。借用射击手的区分,能力是平均弹着点的位置;可靠性是弹着群的大小。我提出三个主张。第一,区分系统前沿的是精度而非能力,而基准测试文化系统性地未能测量它,报告的是集中趋势而非离散度。第二,精度是可测量的,且廉价、无循环性:在固定温度下对一套确定性打分的任务运行多次,计算每个任务结果的一致性——无需模型在环的评分器。第三,这一测量不仅是描述性的,还能指导决策:它把一致失败(偏离中心的密集弹着群,可通过第1篇论文的操作纪律修正——一次瞄准调整)与散乱失败(宽弹着群,只能通过更换模型或其采样来修正——枪的问题)区分开来。我定义了一个分组指标,规定了测量框架,并展示追踪人机组合的分组随时间变化如何产生第1篇论文现场研究所需的复利信号。一次真实运行(此后已复现)既说明了方法,也说明了其最重要的局限:一个测得的差距被单条规则完全消除(0/5 -> 5/5),而一套由规则本身编写的任务却没有发现价值,因为前沿模型已经内化了显式的良好实践——这确立了一个纪律的价值要通过真实工作上的测量来发现,而不是从它自己的规则手册中构造出来。