论文

前沿AI预测存在测量问题:对进展证据的审计

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

模型评测评测方法与指标

摘要

对前沿人工智能的定量预测往往将带日期的目标与基准分数、训练算力、发布时间或专家信念的趋势联系起来。本文审计在再拟合一条趋势之前,公开测量记录是否支持这些联系。我构建了一个截至2026年8月12日的冻结、以事件为中心的记录,包含62个入选系统、12个版本化基准、七项能力或影响判据、144个分级事件、27条源记录和408个带类型的关系。该记录是审计样本而非普查。只有七个系统同时具备估计训练算力和METR 50%任务时程观测。27个闭源系统中有19个缺乏训练算力数据,包括2026年所有入选的闭源发布;而35个开放权重系统中没有任何一个有METR时程观测。基准更替造成第二个断裂:从METR Time Horizon 1.0到1.1的七系统连接在对数尺度上斜率为1.206(95%置信区间1.021至1.390),而六系统的MMLU到MMLU-Pro比较在logit和probit连接下看似平移型,但在线性和对数连接下不是。已观测到的桥梁仅对约25%附近的斜率偏离具有约80%的检验功效。来源高度集中:71个实质性定量事件中的52个(73.2%)来自同一个测量项目,76.1%是实验室发布。对56个方法与实证来源的综述识别出16个互补的测量方向,涵盖资源、推理预算、可靠性、智能体工作、安全、人类偏好、领域结果和预测回测。没有任何方向能提供替代性标量。结论不是前沿AI预测不可能,而是一个可辩护的带日期预测应是对一个版本化测量系统的主张,需显式说明数据连接、协议、函数形式与来源依赖,而非仅仅一条拟合曲线或日历日期。

前沿AI预测存在测量问题:对进展证据的审计:论文配图
图2:所选 62 系统记录的可观测性。面板 (a) 将预期的 compute–horizon 连接展示为四种互斥的观测模式:仅有 compute、仅有 horizon、两者兼有和两者皆无。面板 (b) 表明缺失遵循闭源/开源权重的划分,并延伸到非 METR 和同行评审的测量。面板 (c) 展示七个被联合观测的系统;拟合线仅为描述性,不被解释为因果关系或稳定的缩放律。