论文

用人工智能预测科学进步

Forecasting Scientific Progress with Artificial Intelligence

模型评测基准与评测资源

摘要

人工智能(AI)越来越多地融入科学发现中,但它是否能够预测科学进步仍不清楚。为了研究这个问题,我们引入了一个基于时间的评估框架,用于预测受控知识约束下的科学进步。我们提出了 CUSP(截止条件未见科学进展),这是一个多学科和事件级基准,通过可行性评估、机械推理、生成解决方案设计和时间预测来评估人工智能系统中的科学预测。在 4,760 个科学事件中,我们观察到当前前沿模型中系统性和领域相关的局限性。虽然模型可以从竞争候选者中识别出合理的研究方向,但它们无法可靠地预测科学进步是否会实现,并系统地错误估计它们何时会发生。各个领域的表现高度异质,人工智能进步的时间比生物学、化学和物理学的进步更容易预测。性能在很大程度上对训练截止之前或之后发生的事件不敏感,这表明这些限制不能仅仅通过训练数据中的知识暴露来解释。在受控的信息访问下,额外的预截止知识可以提高性能,但并不能缩小与完整信息设置的差距,这对于高被引进展来说变得更加明显。模型还表现出系统性过度自信和强烈的反应偏差,表明不确定性估计不可靠。总而言之,当前的人工智能系统不足以作为科学进步的预测工具。获得先验知识并不能转化为可靠的预测,事后信息比前瞻性预测更能提高绩效。

用人工智能预测科学进步
图 2:A) 来源分布:按出版地点细分 4,760 个科学里程碑。 B) 按领域划分的任务密度:17,429 个经过验证的任务在 9 个顶级领域中的分布。 C) 时间信息:2024 年 1 月至 2026 年 3 月的条目纵向计数。D) 多学科分类法:不同子类别的旭日可视化。 E) 人类与人工智能的保持率:根据研究生水平的人类专家校准 Grok-3 验证管道。 F) 验证协议:自动判断的可靠性指标,在所有问题模式中显示出高精度。