前沿模型的成长烦恼:当排行榜停止分离时以及下一步要衡量什么
The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next
摘要
排行榜在独立轴上对前沿模型进行排名,但没有揭示功能是否在版本间增强或权衡——而在前沿,这种交互是信息更丰富的信号。我们将配对的 SWE-bench 和 GPQA Diamond 分数分解为群体耦合趋势和每次发布残差($h$-field),从两个公共基准分数诊断能力重点。在来自 10 个实验室 (2024--2026) 的 34 个模型中,能力合作 ($r = +0.72$, $p < 10^{-6}$),但合作存在系统性差异:每个实验室的耦合斜率跨越 $5\times$(Google $1.15$ vs DeepSeek $0.23$),以及实验室的枢纽——DeepSeek 从推理丰富转向编码优先($Δh = 15.9$~每人);人为因素在编码偏移和恢复之间振荡。总体回归充当等倾相边界:识别基本尺度耦合转变的相同 $\sqrt{(a/b)\cdot B_1}$ 分类器 [Amin, 2026] 对前沿模型进行分类,并已检测到下一个转变时的混合相行为(GPQA-IFEval 等倾线以下的两个模型)。 $h$ 字段不仅仅是诊断性的——它告诉您要更改什么。预训练在 0.871 美元处建立耦合,而 RLHF 增加 0.081 美元[Amin,2026]:预训练级别的变化是永久性的(DeepSeek 的四个版本逆转仍然存在),后训练 变化是可逆的(Anthropic 的三个编码偏移均在一个版本内恢复),单独的推理计算将 $h$ 变化$+7.8$~pp 无需再训练。了解哪个组件占主导地位决定是重新训练还是等待。我们提供三步诊断(定位、分类、预测)、每个实验室的测量优先级表以及带有时间戳标准的七个可证伪的预测。五个截止后版本落在 95% 的预测区间内。代码、数据和交互式仪表板:https://zehenlabs.com/cape/。